POST-TRAINING · ON-POLICY DISTILLATION

Rethinking On-Policy Distillation I

더 강한 teacher가 학생을 전혀 못 가르치는 경우가 있다. OPD의 성패를 가르는 것은 benchmark 점수가 아니라 thinking pattern의 호환성학생이 아직 못 본 새 지식의 유무이며, 성공한 OPD는 학생이 방문한 state에서 고확률 token이 점진적으로 정렬되는 한 가지 신호로 나타난다.

arXiv2604.13016v2
상태arXiv preprint
게재2026-04-14
저자Yaxuan Li 외 10명
분야cs.LG
원문PDF ↗
72% → 91%
성공한 OPD에서 student·teacher top-k token overlap ratio의 상승 폭. 실패한 run은 처음부터 정체
97–99%
overlap token이 두 분포에서 차지하는 확률 질량. 정렬은 소수의 공유 token 위에서 일어난다
같은 곡선
JustRL-1.5B에 R1-Distill-1.5B와 7B teacher를 각각 붙였을 때 학습 궤적이 거의 동일. 7B가 점수는 더 높지만 학생 관점에서 구별 불가
+0.37 → +0.02
학생 prefix 1K vs 16K에서 teacher 이어쓰기의 정확도 우위. dense reward의 신뢰도는 깊이에 따라 무너진다
01SUMMARY

요약 — 이 논문이 한 일

On-policy distillation(OPD)은 학생이 스스로 생성한 rollout 위에서 teacher의 token별 log-probability를 dense reward로 쓰는 post-training 기법이다. Qwen3·MiMo·GLM-5가 채택했고 Thinking Machines Lab이 RL 대비 적은 비용으로 재현했지만, 왜 token 수준 신호가 학생을 올바른 방향으로 옮기는지, 언제 실패하는지는 거의 연구되지 않았다. 이 논문은 현상(§3) → 기제(§4) → 처방(§5) → 비용(§6) 순으로 OPD를 체계적으로 분석한다.

현상

성패를 가르는 두 조건

(i) student와 teacher의 thinking pattern이 호환돼야 하고, (ii) 점수가 높더라도 teacher가 학생이 학습 중에 못 본 새 능력을 갖고 있어야 한다. 같은 데이터·같은 recipe로 만든 1.5B와 7B는 학생 눈에 구별되지 않는다.

기제

고확률 token의 점진적 정렬

성공한 run은 학생 방문 state에서 overlap ratio 상승, overlap-token advantage 0 접근, entropy gap 축소가 함께 나타난다. overlap token만 학습해도 전체 top-k와 성능이 같다.

처방

실패하는 OPD 되살리기

teacher rollout으로 SFT를 먼저 하는 off-policy cold start, 그리고 teacher의 post-training prompt를 쓰는 teacher-aligned prompt selection.

비용

dense reward는 공짜가 아니다

reward 품질이 trajectory 깊이에 따라 떨어지고 불안정은 뒤쪽 token에서 시작해 앞으로 번진다. 실패한 teacher도 전역적으로는 정보가 있는데 국소적으로 못 쓴다.

Figure 1. 논문 개요. 왼쪽: 같은 pipeline의 더 큰 teacher(DS-7B)는 gap recovery 5.3%에 그치고 RL을 거친 SW-7B는 16.9%, Qwen 계열도 15.6% vs 58.6%. 점수가 높다고 정보 이득이 있는 것이 아니다. 가운데: JustRL-1.5B를 약한 DS-1.5B와 강한 DS-7B로 되돌려 증류하면 두 궤적이 겹친다. OPD는 thinking pattern을 배우며 성능은 중요하지 않다. 오른쪽: 성공 run(JustRL-1.5B→DS-1.5B)은 overlap ratio가 계속 오르고 실패 run(DS-7B→DS-1.5B)은 정체한다.

핵심 결과 한눈에

질문실험결과
더 강한 teacher가 항상 낫나Qwen3-1.7B-Base ← Qwen3-4B(Non-thinking) vs Qwen3-4B-Base-GRPO점수는 비슷해도 base 학생과 pattern이 맞는 GRPO teacher가 일관되게 우세. 초기 overlap이 결과를 예고
점수 = 새 지식인가같은 pipeline teacher vs 추가 RL teacher (DeepSeek·Qwen family)RL teacher만 큰 이득. gap recovery 5.3→16.9%, 15.6→58.6%
OPD는 무엇을 옮기나JustRL-1.5B ← 자기 pre-RL checkpoint / DS-7B둘 다 pre-RL 성능으로 퇴행, 궤적 동일. 지식이 아니라 pattern을 옮긴다
성공의 신호는R1-Distill-1.5B ← JustRL-1.5B(성공) vs R1-Distill-7B(실패)성공 run만 overlap 72→91%, advantage→0, entropy gap 축소. 공유 token이 질량 97–99%
어디서 배우나Student / Overlap / Non-Overlap Top-16Overlap만으로 Student Top-k와 동일. Non-Overlap은 일관되게 약함
실패를 살리려면teacher rollout SFT cold start · teacher-aligned prompt둘 다 overlap을 올려 회복. prompt 정렬은 entropy를 깎으므로 혼합
dense reward의 대가응답 길이 0.5K–15K · prefix 깊이별 teacher 이어쓰기3K–7K가 최적, 10K+는 후반 붕괴. teacher 우위 +0.37(1K)→+0.02(16K)
02PRELIMINARIES

배경 — OPD의 세 가지 구현과 진단 지표

OPD는 학생 $\pi_\theta$가 생성한 rollout $\hat y$ 위에서 sequence-level reverse KL을 최소화하며, 이는 token-level KL의 합으로 정확히 분해된다.

$$ \mathcal{L}_{\mathrm{OPD}}(\theta)=\mathbb{E}_{x\sim\mathcal{D}_x,\;\hat y\sim\pi_\theta(\cdot\mid x)}\left[\sum_{t=1}^{T} D_{\mathrm{KL}}\big(p_t\,\|\,q_t\big)\right] $$

여기서 $p_t,q_t$는 학생 prefix $\hat y_{<t}$에서의 student·teacher 다음 token 분포다. 구현은 이 per-token KL을 어떻게 추정하느냐로 갈린다.

변형계산 대상특징
Sampled-token OPD학생이 뽑은 token 하나: $\ell_t=\log p_t(\hat y_t)-\log q_t(\hat y_t)$가장 가볍고 가장 흔한 구현. 기대값이 정확히 token-level KL인 unbiased 추정
Full-vocabulary OPD전체 vocabulary에 대한 KL가장 dense하지만 $O(BTM)$ 메모리
Top-$k$ OPD학생 top-$k$ 집합 $S_t$ 위에서 재정규화한 subset KL중간 비용으로 다중 token 감독 유지. 이 논문의 기본 설정, $k=16$

학습 내내 추적하는 진단 지표는 세 가지다.

Overlap ratio

student와 teacher의 top-$k$ 집합이 겹치는 비율 $\mathbb{E}_t\big[|S_t^{(p)}\cap S_t^{(q)}|/k\big]$. 낮으면 mode mismatch, 1에 가까우면 학생이 teacher의 support를 찾은 것

Overlap-token advantage

겹치는 token 위에서 $\bar p_t(v)\big(\log\bar q_t(v)-\log\bar p_t(v)\big)$의 평균. 0에 가까우면 적절한 확신으로 정렬, 크게 음수면 학생이 teacher보다 과신

Entropy gap

$\Delta H_t=|H(q_t)-H(p_t)|$. 같은 state에서 두 모델의 불확실성 profile 차이

03PHENOMENOLOGY I

현상 I — thinking pattern이 맞아야 한다

설정. 학생은 Qwen3-1.7B-Base. teacher는 Qwen3-4B(Non-thinking)와, Qwen3-4B-Base에 GRPO zero-RL을 적용한 Qwen3-4B-Base-GRPO. 데이터는 DAPO-Math-17K, 평가는 AIME 2024·AIME 2025·AMC 2023의 avg@16.

Figure 2. thinking pattern이 다른 두 teacher에서 같은 학생(Qwen3-1.7B-Base)으로 OPD. GRPO teacher(파랑)가 평균 검증 정확도(왼쪽)에서 앞서고 초기 overlap ratio(오른쪽)도 높다. 후반에 overlap이 수렴해도 성능 격차는 남는다.

결과. 두 teacher의 benchmark 점수는 비슷한데, base 학생과 thinking pattern이 가까운 GRPO teacher에서 distillation이 일관되게 더 좋다. GRPO teacher는 초기 overlap ratio가 더 높다. 학습 후반에 두 run의 overlap 곡선이 수렴해도 성능 격차는 남는다. 초기의 pattern mismatch가 만든 손실은 나중에 회복되지 않는다.

관찰

점수가 아니라 pattern

benchmark가 비슷해도 학생과 사고 방식이 맞는 teacher가 이긴다

신호

초기 overlap ratio

학습 전 top-k 겹침이 높을수록 결과가 좋다. 사전 예측 지표로 쓸 수 있다

함의

초기 손실은 영구적

overlap이 나중에 따라잡아도 성능은 못 따라잡는다

04PHENOMENOLOGY II

현상 II — 점수가 높다고 새 지식은 아니다

Thinking pattern이 맞고 점수도 높은데 OPD가 실패하는 경우가 있다. 두 model family에서 같은 pipeline의 teacher추가 RL을 거친 teacher를 대조한다.

Family학생같은 pipeline teacher추가 RL teacher
DeepSeekR1-Distill-1.5BR1-Distill-7BSkywork-OR1-Math-7B (R1-Distill-7B + RL)
QwenQwen3-1.7B (Non-thinking)Qwen3-4B (Non-thinking)Qwen3-4B-Non-Thinking-RL-Math (DeepMath 57K로 RL)
Figure 4. teacher의 추가 RL post-training 유무에 따른 OPD 성능. 왼쪽 DeepSeek family, 오른쪽 Qwen family. RL을 거친 teacher(파랑)가 훨씬 큰 이득과 높은 gap recovery rate를 낸다. 같은 pipeline teacher(주황)는 거의 평평하다.

두 family 모두 같은 pipeline의 teacher는 개선이 제한적이고, RL을 거친 teacher는 모든 benchmark에서 훨씬 큰 이득을 낸다. gap recovery rate $(\mathrm{Acc}_{\text{after}}-\mathrm{Acc}_{\text{before}})/(\mathrm{Acc}_{\text{teacher}}-\mathrm{Acc}_{\text{before}})$도 훨씬 높다. RL teacher는 같은 base checkpoint에서 나왔으므로 thinking pattern은 유지된 채, RL로 얻은 새 능력만 추가된 것이다. 같은 데이터와 recipe로 학습한 두 모델은 각자의 규모에서 비슷한 분포로 수렴해 teacher가 넘겨줄 신호가 거의 없다.

05REVERSE DISTILLATION

검증 — 거꾸로 증류해 보기

두 조건을 동시에 검증하는 실험이다. JustRL-1.5B는 R1-Distill-1.5B에 RL을 적용해 만든 모델이다. 이제 JustRL-1.5B를 학생으로, 자기 pre-RL checkpoint인 R1-Distill-1.5B를 teacher로 거꾸로 증류한다. 비교군으로 같은 family의 R1-Distill-7B도 teacher로 쓴다. 7B는 JustRL-1.5B보다 점수가 약간 높고, 1.5B는 훨씬 낮다.

결과 1

pre-RL checkpoint로 증류하면 학생은 RL로 얻은 이득을 전부 잃고 거의 정확히 pre-RL 성능으로 되돌아간다

결과 2

teacher를 7B로 바꿔도 학습 궤적이 거의 구별되지 않는다. 학생보다 점수가 높은 7B가 1.5B와 똑같은 수준으로 학생을 퇴행시킨다

해석

OPD는 학생 방문 state 위의 reverse KL이므로, 두 teacher가 그 state에서 거의 같은 국소 목표 분포를 만든다는 뜻이다

Figure 5. JustRL-1.5B를 학생으로 같은 family의 두 teacher(R1-Distill-1.5B·7B)로 되돌려 증류. 세 benchmark 모두에서 두 run이 거의 같은 수준으로 퇴행한다. 7B가 학생보다 점수가 높은데도 그렇다. OPD dynamics는 benchmark 성능이 아니라 thinking pattern이 지배한다.

여기서 세 가지 결론이 나온다.

  • OPD는 thinking pattern을 배운다. teacher의 pattern을 적극적으로 획득해 학생 자신의 것을 덮어쓴다. 그래서 pattern이 너무 다르면 학습이 안 된다.
  • Benchmark 점수는 OPD 결과를 예측하지 못한다. 점수가 더 높은 teacher가 개선은커녕 퇴행을 일으킬 수 있다. 학습 dynamics는 점수와 완전히 분리될 수 있다.
  • 높은 점수 ≠ 새 지식. 규모만 다른 같은 family의 두 모델은 학생에게 같은 효과를 낸다. 점수 차이는 같은 데이터에 대한 적합도 차이일 뿐이다.
06MECHANISM

기제 — 고확률 token의 점진적 정렬

설정. 학생 R1-Distill-1.5B에 JustRL-1.5B(성공)와 R1-Distill-7B(실패) teacher를 붙이고 세 지표를 추적한다. 두 teacher의 수학 성능은 비슷하며 7B가 약간 높다.

결과. JustRL-1.5B로부터는 teacher와의 격차 80% 이상을 회복하고, R1-Distill-7B로부터는 전혀 개선되지 않는다. dynamics가 갈림길을 보여준다.

Figure 6. 같은 학생(R1-Distill-1.5B), 두 teacher의 성공 vs 실패. 위: 세 benchmark avg@16, 점선은 teacher. 아래: overlap ratio·overlap-token advantage·entropy gap. 성공 run(파랑)만 overlap이 오르고 gap이 좁아진다. 실패 run(빨강)은 세 지표 모두 정체.
지표성공 run (JustRL-1.5B)실패 run (R1-Distill-7B)
Overlap ratio꾸준히 상승정체
Overlap-token advantage0을 향해 개선정체
Entropy gap축소처음부터 mismatch 지속
보조 지표 (Appendix B.2)loss 감소·gradient 크기 유지약한 gradient·확률 불일치 지속

두 가지가 중요하다. 첫째, overlap token은 학습 내내 두 모델 확률 질량의 97–99%를 차지하므로 overlap 상승은 집합 수준의 우연이 아니라 확률적으로 지배적인 token의 정렬이다. 둘째, overlap-token advantage의 개선은 OPD의 주된 최적화 신호가 overlap 영역 안에서의 확률 재배분임을 뜻한다.

공유 token만 학습해도 충분하다

성공 설정에서 loss가 덮는 token 집합만 바꾼 세 변형을 비교한다. (i) Student Top-$k$: 학생 top-$k$ 전체 $S_t^{(p)}$, (ii) Overlap Top-$k$: 교집합 $S_t^{(p)}\cap S_t^{(q)}$, (iii) Non-Overlap Top-$k$: 대칭차 $S_t^{(p)}\triangle S_t^{(q)}$. $k=16$.

Figure 7. Top-$k$ OPD의 최적화 support ablation. Overlap Top-$k$(주황)가 Student Top-$k$(파랑)와 겹치고, Non-Overlap Top-$k$(회색)는 정확도·overlap ratio·advantage 모두 뚜렷이 약하다.
  • Overlap Top-$k$는 세 benchmark 모두에서 Student Top-$k$의 이득을 거의 전부 회복한다. Non-Overlap Top-$k$는 일관되게 약하다.
  • Student Top-$k$와 Overlap Top-$k$의 overlap-token advantage 곡선은 거의 구별되지 않는다. 학생 전용 token은 확률 질량이 매우 작기 때문이다.
  • 자기 강화 dynamics: Student·Overlap Top-$k$는 overlap ratio를 약 72%에서 91% 이상으로 꾸준히 올리는 반면, Non-Overlap Top-$k$는 먼저 떨어졌다가 부분 회복한다. token이 공유 고확률 영역에 들어와 teacher가 선호하면 reverse KL이 그 token에 질량을 더 모으고, 경쟁하는 non-overlap token을 학생 top-$k$ 밖으로 밀어낸다. overlap 영역은 최적화에도 불구하고가 아니라 최적화 때문에 자란다.
통일된 그림

OPD의 1차 효과

학생 방문 state에서 teacher가 지지하는 고확률 token에 대한 학생 분포를 점진적으로 다듬는 것

신호이자 장소

overlap 영역

성공의 signature이면서 동시에 gradient가 실제로 작동하는 locus. non-overlap token의 기여는 작다

조건과 연결

§3의 두 조건이 충족되면

자기 강화 dynamics가 꾸준한 개선을 만들고, 아니면 overlap이 정체해 학습이 진행되지 않는다

07RECIPE I

처방 I — teacher rollout으로 cold start

새 지식은 teacher 고유 속성이라 바꿀 수 없지만, thinking pattern 격차는 학습 설계로 줄일 수 있다. 첫 번째 처방은 off-policy cold start다. teacher가 생성한 rollout으로 학생을 먼저 SFT해 pattern을 가깝게 만든 뒤 표준 OPD를 이어 간다.

설정. 학생 Qwen3-1.7B-Base, teacher Qwen3-4B(Non-thinking). OpenThoughts3-1.2M의 수학 subset에서 teacher가 200K 응답을 생성하고 이를 SFT해 Qwen3-1.7B-SFT를 만든다. 이어서 SFT prompt와 중복 제거한 나머지 약 30K prompt로 OPD. 대조군은 같은 teacher·같은 OPD prompt로 Base에서 바로 시작하는 pure OPD.

성능

SFT 초기화가 학습 내내 일관되게 앞선다. 격차가 유지되므로 cold start는 초기 최적화뿐 아니라 후속 OPD의 최종 상한을 높인다

Overlap

SFT 학생은 훨씬 높은 overlap ratio에서 시작해 매끄럽게 진행한다. Base 학생은 낮게 시작해 뚜렷한 불안정을 겪은 뒤 서서히 회복한다

Entropy gap

SFT 학생이 처음부터 훨씬 작다. teacher의 confidence profile에 가까운 상태에서 출발한다

Figure 8. OPD 전 off-policy cold start의 효과. teacher는 Qwen3-4B(Non-thinking) 고정. Qwen3-1.7B-SFT에서 시작한 run(주황)이 Base에서 시작한 run(파랑)보다 정확도·overlap 모두 높고 안정적이며, 격차가 끝까지 유지된다.

Off-policy distillation이 초기 pattern mismatch를 줄여, OPD가 시작되는 순간부터 teacher의 token 수준 감독을 활용할 수 있게 만든다.

08RECIPE II

처방 II — teacher의 post-training prompt를 쓴다

두 번째 처방은 데이터 쪽에서 정렬을 높인다. teacher의 policy는 post-training에서 본 prompt에 의해 형성되므로, teacher-aligned prompt로 OPD하면 감독이 더 효과적이다. 두 granularity에서 실험한다.

실험학생 → teacher비교결과
Prompt templateR1-Distill-1.5B ← JustRL-1.5B표준 DAPO 템플릿 vs JustRL post-training에 쓰인 템플릿, 문제는 동일템플릿만 바꿔도 세 benchmark 모두 향상. teacher-aligned run은 더 높은 overlap에서 시작해 더 높게 수렴
Prompt contentQwen3-1.7B-Base ← Qwen3-4B-Base-GRPODAPO-Math-17K(teacher RL 데이터와 일치) vs 중복 제거한 DeepMath subset, 크기 동일teacher-aligned 쪽이 downstream 우세. 단 overlap ratio는 오히려 낮고, overlap token의 누적 확률 질량은 훨씬 높다
Figure 9. prompt 템플릿 정렬 효과. 같은 DAPO-Math-17K 문제를 teacher(JustRL) post-training 템플릿으로 제시하면(주황) 평균 정확도와 overlap ratio가 학습 내내 높다.
Figure 10. prompt 내용 정렬 효과. teacher의 RL 데이터인 DAPO-Math-17K(주황) vs 중복 제거한 DeepMath(파랑). 정확도는 teacher-aligned 쪽이 높고 overlap token의 누적 질량도 크지만, overlap ratio는 오히려 낮고 학생 entropy가 크게 떨어진다.

Prompt content 실험의 미묘한 점은 학생이 더 적지만 더 강하게 공유되는 token에 질량을 집중한다는 것이다. overlap 집합은 작아지지만 고확률 token에 대한 유효 정렬은 강해진다. 동시에 학생 entropy가 크게 낮아진다. teacher의 post-training prompt만 쓰면 policy entropy를 과도하게 줄여 탐색 능력을 해칠 수 있으므로, 실전에서는 teacher-aligned prompt와 그 밖의 prompt를 섞는 전략이 더 견고하다.

09COST

비용 — dense reward는 깊이에 따라 무너진다

OPD의 매력은 모든 token이 reward를 받는 dense supervision이다. 그러나 이는 teacher의 token 수준 reward가 학생 방문 state에서 신뢰할 만하다는 가정에 기댄다.

응답 길이에는 sweet spot이 있다

Figure 11. (a) 응답 길이별 검증 정확도, (b) 학생 prefix 길이별 teacher 이어쓰기의 정확도 이득. 3K·7K가 가장 좋고 10K·15K는 정체·하락. teacher 이어쓰기 이득은 1K prefix +0.37에서 16K +0.02로 단조 감소.

최대 응답 길이를 0.5K부터 15K까지 바꾸면, 0.5K·1K는 감독 token이 너무 적어 sample-efficient하지 않고, 3K·7K가 가장 강하며, 10K·15K는 정체하거나 하락한다. 10K·15K는 후반에 overlap ratio가 급락하고 학생 entropy와 gradient norm이 튀는 late-stage collapse를 보인다.

Figure 12. 최대 응답 길이별 학습 dynamics. 10K·15K(보라·노랑)에서 후반에 overlap ratio가 급락하고 학생 entropy와 gradient norm이 튄다. 3K·7K는 매끄럽다.
Figure 13. 15K 설정에서 출력 위치별 학생 entropy (Step 180–250). 높은 entropy가 응답 끝에서 먼저 나타나 학습이 진행될수록 앞쪽 token으로 번진다. 불안정은 뒤에서 앞으로 전파된다.
Figure 23. 같은 설정에서 출력 위치별 teacher entropy. teacher도 suffix에서 prefix로 entropy가 올라가는 같은 경향을 보인다. 뒤쪽 위치일수록 teacher가 낯선 prefix를 만나 더 noisy한 reward를 내고, 그것이 다시 학생을 불안정하게 만든다.

Teacher 이어쓰기는 prefix가 깊을수록 약해진다

DAPO-Math-17K에서 2K prompt를 뽑아 16K token을 넘는 학생 rollout을 여러 위치에서 자르고 teacher가 이어 쓰게 하면, teacher의 정확도 우위는 1K prefix에서 +0.37, 16K prefix에서 +0.02로 단조 감소한다. dense reward는 중간 길이의 추론에는 효과적이지만 학생 prefix가 teacher에게 익숙한 state에서 멀어질수록 신뢰도가 떨어진다. 긴 chain-of-thought나 agentic multi-turn 같은 long-horizon 설정으로 OPD가 깔끔하게 확장되지 않을 수 있다.

전역적으로 유익한 reward가 국소적으로 쓸 수 있다는 보장은 없다

실패한 7B teacher의 reward가 근본적으로 무정보인지 확인하기 위해 학생 rollout별 sequence mean reward $\bar r(y)$가 정답·오답을 얼마나 구분하는지 본다. 두 teacher 모두 정답 rollout에 더 높은 reward를 주며 AUROC는 0.73(JustRL-1.5B)과 0.75(R1-Distill-7B)로 비슷하다. 실패한 teacher의 전역 신호가 더 약하지 않다.

Figure 14. 정답·오답 학생 rollout의 sequence mean reward 분포. 두 teacher 모두 정답 rollout에 더 높은 reward를 준다. AUROC 0.73(JustRL-1.5B)·0.75(R1-Distill-7B). 실패한 teacher의 전역 신호가 더 약하지 않다.

그렇다면 왜 실패하는가. 7B teacher에서는 후반에 overlap-token advantage 크기가 더 큰데도 gradient norm은 계속 작다. 가설은 anisotropy다. 7B의 per-token advantage가 개별적으로는 크지만 sequence 안 위치마다 방향이 제각각이라 gradient로 합쳐질 때 서로 상쇄된다. 호환되는 pattern의 JustRL-1.5B는 더 일관된 token 부분집합에 advantage를 집중해, 작은 신호라도 reverse KL의 mode-seeking이 증폭할 수 있는 한 방향을 가리킨다. 이 가설은 직접 검증되지 않았고 per-token gradient의 방향 구조 분석이 필요하다.

Sampled-token reward로 이미 충분하다

학생 R1-Distill-1.5B, teacher JustRL-1.5B에서 Top-$k$ OPD($k\in\{1,4,16,64\}$)와 sampled-token OPD를 비교하면 sampled-token은 Top-$k$ 평균과 대등하다. 유일하게 나쁜 설정은 Top-1이며 $k$를 4 이상으로 키워도 이득은 미미하다. :::figure assets/fig-15.png Figure 15. Top-$k$ OPD의 support 크기 $k$ 효과 (avg@16). sampled-token OPD가 Top-4·16·64와 대등하고 Top-1만 일관되게 낮다. :::

Figure 16. support 크기별 학습 dynamics. Top-1(하늘색)은 overlap이 불안정하고 entropy·gradient norm이 튄다. Top-4는 후반에 한 번 꺼지고, Top-16·64는 내내 매끄럽다.

Top-1은 항상 argmax token만 골라 reward를 한 mode에 집중시키고, 작은 policy 변화로 1위 token이 바뀌어 신호가 불안정해진다. sampled-token은 매 step 학생 분포에 비례해 다른 token을 뽑으므로 고확률 영역을 unbiased하게 덮는다. 문제는 token 수가 아니라 편향된 mode-집중 선택 규칙이다.

10CONTEXT

관련 연구와 남은 질문

  • Off-policy KD의 한계: Kim & Rush(2016)의 sequence-level distillation 계열은 teacher 생성 sequence로 학습하고 추론은 학생 분포에서 하므로 exposure bias가 누적된다. 이 mismatch가 OPD의 동기다.
  • OPD 계보: MiniLLM(reverse KL을 policy gradient로), GKD(on/off-policy와 divergence를 잇는 통합 틀), Yang et al. 2026(OPD를 dense KL-constrained RL의 특수 경우로 형식화). 산업 pipeline과 self-distillation으로 확장됐지만 언제·왜 실패하는지의 체계적 분석은 없었다.
  • Capacity gap: Cho & Hariharan, teacher assistant, distillation scaling law의 U자형 regime, long CoT의 learnability gap 등은 대부분 off-policy KD에 관한 것이다. OPD에서의 distillability는 미개척이었다.

한계와 향후 과제

  • 모든 실험이 수학 benchmark다. code·open-ended 영역에서도 같은 조건과 기제가 성립하는지는 열려 있다.
  • "새 지식" 조건은 pre-training corpus 차이에 기대는데, cross-family 증류는 tokenizer·architecture 차이와 뒤섞이고 통제된 pre-training ablation은 너무 비싸다.
  • Self-distillation에서는 pattern 일관성이 보장되고 novelty가 privileged information에서 오므로, 같은 통찰을 확장하는 것이 자연스러운 다음 단계다.
  • Long-horizon 한계는 짧은 구간의 dense token 감독과 긴 horizon의 sparse outcome reward를 결합하는 hybrid, 감독 horizon을 점진적으로 늘리는 curriculum을 시사한다.
11TAKEAWAY

한 장으로 끝내는 정리

조건

OPD가 되려면 student·teacher의 thinking pattern이 호환돼야 하고, teacher가 학생이 못 본 새 능력을 가져야 한다. 점수는 둘 다 예측하지 못한다

검증

JustRL-1.5B를 pre-RL checkpoint로 되돌려 증류하면 RL 이득이 전부 사라지고, 점수 높은 7B teacher도 똑같은 곡선을 그린다. OPD는 pattern을 옮긴다

기제

성공 = 학생 방문 state에서 고확률 공유 token의 점진적 정렬. overlap ratio 72→91%, 공유 token이 질량 97–99%, overlap token만 학습해도 충분

처방

teacher rollout SFT로 cold start하면 초기 overlap이 올라가 상한까지 높아진다. teacher의 post-training prompt는 정렬을 날카롭게 하지만 entropy를 깎으므로 섞어 쓴다

비용

reward 품질은 깊이에 따라 떨어지고(teacher 우위 +0.37→+0.02) 불안정은 뒤에서 앞으로 번진다. 실패한 teacher도 AUROC 0.75로 전역 정보는 있으나 국소 기하가 문제다

실무에 남는 것

  • teacher를 고를 때 초기 overlap ratio를 먼저 재라. benchmark 점수보다 결과를 잘 예측한다.
  • 같은 pipeline의 더 큰 모델은 teacher로 쓸모가 적다. RL 등으로 새 능력을 얻은 모델이어야 넘겨줄 것이 있다.
  • pattern이 다르면 SFT cold start부터. OPD 전에 teacher rollout으로 짧게 맞추는 것이 최종 성능까지 올린다.
  • 응답 길이는 3K–7K 근처가 안전하다. 10K 이상에서는 late-stage collapse를 감시해야 한다.
  • Top-1만 피하면 $k$는 중요하지 않다. sampled-token OPD로도 충분하다.

핵심 메시지: OPD는 지식이 아니라 사고 패턴을 학생 방문 state의 고확률 token 위에서 옮기는 절차이며, 그 전제가 맞지 않으면 아무리 강한 teacher도 신호를 전달하지 못한다.

Thank You!