논문 발표자료

Post-training · 6편

  1. SFT · RL initialization
    TailSFT: Filtered Fine-Tuning Improves Post-Training Performance
    Malladi et al. · arXiv 2608.25756 · 2026-08
  2. Forgetting · on-policy data
    Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
    Chen et al. · arXiv 2510.18874 · ICML 2026
  3. On-policy distillation · Part I
    Rethinking On-Policy Distillation of LLMs: Phenomenology, Mechanism, and Recipe
    Li et al. · arXiv 2604.13016 · 2026-04
  4. On-policy distillation · Part II
    Rethinking On-Policy Distillation of LLMs II: One Training Example
    Fu et al. · arXiv 2609.04172 · 2026-09
  5. Continual learning · Self-distillation
    Self-Distillation Enables Continual Learning
    Shenfeld · Damani · Hübotter · Agrawal
    MIT / Improbable AI Lab + ETH Zurich · ICML 2026 · arXiv 2601.19897v2
  6. On-policy distillation · Data selection
    What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection
    Hou et al. · Tsinghua + Meituan · arXiv 2609.05198 · 2026-09