2026년 4월 24일, DeepSeek이 V4 Preview를 공개했다. 1M 컨텍스트가 지원이 아니라 기본값이 되었다. Pro 모델과 Flash 모델, MIT 오픈 가중치.
Flash는 출시 당일부터 실제로 작동했다. 목록가 0.28 per million token.
Pro 모델이 1M 컨텍스트를 처리할 때: V3.2 대비 27% FLOPs, KV 캐시는 10%만 사용.
어텐션 구조
V4의 핵심은 세 가지 어텐션의 조합이다.
CSA ↔ HCA interleave
CSA (Compressed Sparse Attention): 4개 토큰을 하나의 KV로 풀링한 뒤 관련성 높은 top-k만 선택. 입력 대부분은 압축되고, 중요한 부분만 full resolution.
HCA (Heavily Compressed Attention): 128개 토큰을 하나로 풀링한 뒤 dense MQA. 먼 컨텍스트는 요약 형태로만 존재.
Uncompressed window: 최근 128 토큰은 압축하지 않는다. 즉각적인 컨텍스트는 full fidelity.
레이어마다 CSA와 HCA를 인터리브. 각 레이어는 다른 해상도에서 컨텍스트를 본다.
DSA는 V3.2-Exp에서 가져왔다. 새로운 건 앞단 compression과 HCA 조합.
숫자
| 모델 | Total params | Active | 컨텍스트 |
|---|---|---|---|
| Pro | 1.6T | 49B | 1M (default) |
| Flash | 284B | 13B | 1M (default) |
두 모델 모두 MIT. 1M은 플래그가 아니라 기본값.
커뮤니티 반응
Hacker News ~2091점. 논점은 효율과 가격, 그리고 Flash가 출시 당일부터 쓸 수 있었다는 쪽.
기술 리포트 arXiv 2606.19348.
2024년 Gemini 1.5 Pro는 1M을 “기술적으로 가능”하다고 보여줬다. API 제한, 느림, 비쌌음.
V4는 1M을 엔지니어링 기본값으로 만들었다. 플래그 없이, 추가 비용 없이 작동한다.
어텐션이 더 이상 raw 토큰 위에서 돌지 않는다. 풀링하고, 압축하고, 선택한다.