포스트트레인 vs 프리트레인
같은 뇌, 연습만 다르게
지금 상태
같은 뇌, 워커가 연습을 받았다.
최근 Blog에서는 Compose-CL이 연속학습에서 데이터·함수·가중치 앵커를 조합하는 방식을 다뤘습니다.
큰그림
Post-training은 instruction tuning, RLHF/DPO, task-specific fine-tuning, specialized skill training으로 구성된다.
Flash-0731 사례:
- Base weights: 284B total, 13B active
- Pre-training: 동일
- Post-training: DeepSWE 12.8 → 54.4 (DeepSeek 자체 테이블 기준)
Pro-0813은 V4 Pro base는 동일하지만 post-training만으로 DeepSWE 12.8→62.7을 달성했다. GLM-5.3도 5.2 base는 동일하고 post-train만 업데이트했다.
모델 릴리즈가 반드시 새 프리트레이닝을 의미하지 않는다. 같은 base model을 다른 방식으로 “연습시키는” 것이 제품 차별화의 핵심이 되었다.
최근 Blog
이 허브와 연결된 Blog 포스트입니다.