포스트트레인 vs 프리트레인

같은 뇌, 연습만 다르게

지금 상태

같은 뇌, 워커가 연습을 받았다.

최근 Blog에서는 Compose-CL이 연속학습에서 데이터·함수·가중치 앵커를 조합하는 방식을 다뤘습니다.

큰그림

Post-training은 instruction tuning, RLHF/DPO, task-specific fine-tuning, specialized skill training으로 구성된다.

Flash-0731 사례:

  • Base weights: 284B total, 13B active
  • Pre-training: 동일
  • Post-training: DeepSWE 12.8 → 54.4 (DeepSeek 자체 테이블 기준)

Pro-0813은 V4 Pro base는 동일하지만 post-training만으로 DeepSWE 12.8→62.7을 달성했다. GLM-5.3도 5.2 base는 동일하고 post-train만 업데이트했다.

모델 릴리즈가 반드시 새 프리트레이닝을 의미하지 않는다. 같은 base model을 다른 방식으로 “연습시키는” 것이 제품 차별화의 핵심이 되었다.

이 허브와 연결된 Blog 포스트입니다.