온폴리시 증류 (on-policy distillation, OPD) 모델이 생성한 데이터 중 우수한 샘플을 다시 학습에 활용해 성능을 고도화하는 기법 용례 "포스트 트레이닝 레시피는 알고리즘 수정 없이 표준적인 SFT, RL, 온폴리시 증류 패러다임을 따름" - DeepSeek-V4.1-Flash: 초저비용·고성능 멀티모달 모델의 등장