2026년 4월 24일, DeepSeek이 V4 Preview를 공개했다. 1M 컨텍스트가 지원이 아니라 기본값이 되었다. Pro 모델과 Flash 모델, MIT 오픈 가중치.

Flash는 출시 당일부터 실제로 작동했다. 목록가 0.14/0.14/0.28 per million token.

Pro 모델이 1M 컨텍스트를 처리할 때: V3.2 대비 27% FLOPs, KV 캐시는 10%만 사용.

어텐션 구조

V4의 핵심은 세 가지 어텐션의 조합이다.

최근 128 토큰
▮▮▮▮ uncompressed
CSA 레이어
m=4 풀링 → DSA top-k
Flash k=512, Pro k=1024
HCA 레이어
m=128 풀링 → dense MQA
먼 컨텍스트 요약
레이어 배치

CSA ↔ HCA interleave

CSA (Compressed Sparse Attention): 4개 토큰을 하나의 KV로 풀링한 뒤 관련성 높은 top-k만 선택. 입력 대부분은 압축되고, 중요한 부분만 full resolution.

HCA (Heavily Compressed Attention): 128개 토큰을 하나로 풀링한 뒤 dense MQA. 먼 컨텍스트는 요약 형태로만 존재.

Uncompressed window: 최근 128 토큰은 압축하지 않는다. 즉각적인 컨텍스트는 full fidelity.

레이어마다 CSA와 HCA를 인터리브. 각 레이어는 다른 해상도에서 컨텍스트를 본다.

DSA는 V3.2-Exp에서 가져왔다. 새로운 건 앞단 compression과 HCA 조합.

숫자

모델Total paramsActive컨텍스트
Pro1.6T49B1M (default)
Flash284B13B1M (default)

두 모델 모두 MIT. 1M은 플래그가 아니라 기본값.

커뮤니티 반응

Hacker News ~2091점. 논점은 효율과 가격, 그리고 Flash가 출시 당일부터 쓸 수 있었다는 쪽.

기술 리포트 arXiv 2606.19348.

2024년 Gemini 1.5 Pro는 1M을 “기술적으로 가능”하다고 보여줬다. API 제한, 느림, 비쌌음.

V4는 1M을 엔지니어링 기본값으로 만들었다. 플래그 없이, 추가 비용 없이 작동한다.

어텐션이 더 이상 raw 토큰 위에서 돌지 않는다. 풀링하고, 압축하고, 선택한다.