논문 발표자료
Post-training · 6편
- SFT · RL initializationTailSFT: Filtered Fine-Tuning Improves Post-Training PerformanceMalladi et al. · arXiv 2608.25756 · 2026-08
- Forgetting · on-policy dataRetaining by Doing: The Role of On-Policy Data in Mitigating ForgettingChen et al. · arXiv 2510.18874 · ICML 2026
- On-policy distillation · Part IRethinking On-Policy Distillation of LLMs: Phenomenology, Mechanism, and RecipeLi et al. · arXiv 2604.13016 · 2026-04
- On-policy distillation · Part IIRethinking On-Policy Distillation of LLMs II: One Training ExampleFu et al. · arXiv 2609.04172 · 2026-09
- Continual learning · Self-distillationSelf-Distillation Enables Continual LearningShenfeld · Damani · Hübotter · Agrawal
MIT / Improbable AI Lab + ETH Zurich · ICML 2026 · arXiv 2601.19897v2 - On-policy distillation · Data selectionWhat Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data SelectionHou et al. · Tsinghua + Meituan · arXiv 2609.05198 · 2026-09