논문 발표자료

Post-training 4편. 각 항목을 열면 발표 문서가 나옵니다.

  1. SFT · RL initialization
    TailSFT: Filtered Fine-Tuning Improves Post-Training Performance
    Malladi et al. · arXiv 2608.25756 · 2026-08
  2. Forgetting · on-policy data
    Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
    Chen et al. · arXiv 2510.18874 · ICML 2026
  3. On-policy distillation · Part I
    Rethinking On-Policy Distillation of LLMs: Phenomenology, Mechanism, and Recipe
    Li et al. · arXiv 2604.13016 · 2026-04
  4. On-policy distillation · Part II
    Rethinking On-Policy Distillation of LLMs II: One Training Example
    Fu et al. · arXiv 2609.04172 · 2026-09