
S4: 긴 시퀀스를 구조화된 상태공간으로 읽는 법
Structured State Space sequence model(S4)이 긴 의존성을 다루기 위해 상태공간모델을 어떻게 구조화하고, 계산 가능한 Cauchy 커널로 바꾸는지 살펴봅니다. arXiv 초록과 메타데이터에서 확인되는 주장만 구분해 정리합니다.
// TOPIC STREAM
상태공간 시퀀스 모델 / State-space sequence models.

Structured State Space sequence model(S4)이 긴 의존성을 다루기 위해 상태공간모델을 어떻게 구조화하고, 계산 가능한 Cauchy 커널로 바꾸는지 살펴봅니다. arXiv 초록과 메타데이터에서 확인되는 주장만 구분해 정리합니다.

Hungry Hungry Hippos가 상태공간모델의 언어적 약점을 토큰 기억과 비교 능력으로 분해하고, H3와 FlashConv, 하이브리드 attention 조합으로 어떻게 보완하는지 설명합니다.

Mamba가 입력에 따라 상태공간 파라미터를 바꾸는 selective SSM과 하드웨어 인식 병렬 알고리즘으로 긴 시퀀스의 효율성과 언어 모델링 성능을 함께 겨냥한 이유를 설명합니다.

Tri Dao와 Albert Gu의 Mamba-2 논문을 따라가며 상태공간모델과 어텐션의 연결, SSD 알고리즘의 하드웨어적 의미, 그리고 확인되지 않은 주장까지 정리한다.

고정 크기 recurrent hidden state를 기억 장치와 정보 압축의 관점에서 구분한다. S4, Mamba, RWKV, Resona를 중심으로 상태의 역할을 설명하고, Qdrant와 Statey는 외부 메모리 맥락으로 분리해 다룬다.

상태공간 모델과 Transformer의 경쟁을 구조적 대체가 아닌 역할 분담의 문제로 읽는다. Mamba, Griffin, Jamba, Mamba-3의 초록과 공개된 주장에 근거해 긴 문맥·생성·하드웨어 효율성의 트레이드오프를 정리한다.