논문 발표자료
Post-training 4편. 각 항목을 열면 발표 문서가 나옵니다.
- SFT · RL initializationTailSFT: Filtered Fine-Tuning Improves Post-Training PerformanceMalladi et al. · arXiv 2608.25756 · 2026-08
- Forgetting · on-policy dataRetaining by Doing: The Role of On-Policy Data in Mitigating ForgettingChen et al. · arXiv 2510.18874 · ICML 2026
- On-policy distillation · Part IRethinking On-Policy Distillation of LLMs: Phenomenology, Mechanism, and RecipeLi et al. · arXiv 2604.13016 · 2026-04
- On-policy distillation · Part IIRethinking On-Policy Distillation of LLMs II: One Training ExampleFu et al. · arXiv 2609.04172 · 2026-09