OPD는 training example 하나로도 되고, 2,000 step을 돌려도 무너지지 않는다. 어떤 예제가 좋은가를 물으면 답은 어려운 문제다. 이유는 token entropy가 아니라 어려운 문제가 자연스럽게 만드는 긴 CoT이며, 학생도 teacher도 못 푸는 문제에서도 배운다. 어려운 예제 8개면 DAPO-Math-17K 전체와 같은 성능이 나온다.
OPD의 알고리즘 쪽은 많이 연구됐지만 데이터 쪽, 즉 얼마나 필요하고 무엇이 효과적이며 무엇이 개선을 이끄는지는 비어 있었다. 이 논문은 1-shot OPD라는 극단 설정에서 출발해 세 질문에 답한다.
무작위로 뽑은 24개 예제 전부에서 1-shot OPD가 효과가 있고, 어려운 예제 8개로 full-set(17K)과 같은 53.6%에 이른다. 16·64개로 늘려도 더 오르지 않는다.
easy·medium·hard 중 hard로 학습할 때 검증 정확도가 가장 높다. 학습 정확도가 0%에 고정된, 학생과 teacher 모두 못 푸는 문제에서도 검증 정확도는 계속 오른다.
응답 길이를 같게 자르면 hard의 우위가 사라진다. entropy가 아니라 길이다. 긴 CoT는 긴 horizon에서 teacher와의 정렬을 유지시키고 "Alternatively" 같은 반성 pattern을 학습시킨다.
DeepSeek-7B·Qwen3-1.7B-Base·Qwen3-4B-Base에서도 hard 8-shot이 full-set에 근접한다(59.5 vs 59.6, 21.3 vs 22.5, 29.2 vs 30.8).

학생 $\pi_\theta$가 만든 rollout $\hat y$ 위에서 teacher $\pi_T$와의 reverse KL을 최소화한다. sequence 수준 목적은 token 수준으로 정확히 분해된다.
여기서 $p_t(v)=\pi_\theta(v\mid x,\hat y_{<t})$, $q_t(v)=\pi_T(v\mid x,\hat y_{<t})$다. 실험은 student top-$k$ OPD를 쓴다. 학생 확률 상위 $k$개 집합 $S_t=\mathrm{TopK}(p_t,k)$ 위에서 두 분포를 재정규화해 subset KL을 최소화한다.
| 지표 | 정의 | 읽는 법 |
|---|---|---|
| 검증 정확도 | AMC 2023·AIME 2024·AIME 2025, 문제당 16 rollout 평균(temperature 0.7, 16,384 token) | 학습 중 성능 추적 |
| Overlap ratio | held-out 100문제, 16 rollout에서 학생·teacher top-16 집합이 겹치는 비율 | 1에 가까울수록 teacher와 정렬 |
| Per-token KL reduction | 증류 전후 token별 KL 감소량을 token id별로 평균(빈도 0.01% 미만 제외) | 어떤 token이 teacher에 가장 가까워졌나 |
학생을 GRPO로 학습한 것이 teacher. 같은 family라 thinking pattern이 호환된다.
학생·teacher 각각 16 rollout 정답률의 평균 $A_i=(S_i+T_i)/2$로 내림차순 정렬해 $\{\pi_i\}_{i=1}^{1000}$. 인덱스가 곧 난이도 순위.
$A_i>0.9$: π1–π199(199개), $0.1\le A_i\le0.9$: π200–π825(626개), $A_i<0.1$: π826–π1000(175개).
batch 64, prompt당 8 응답, temperature 1.0, 최대 응답 7,168 token, lr 1e-6, KL 계수 0. full-set 1 epoch이 279 step이라 1-shot도 279 step으로 맞춘다. 8×H800.
평가는 AIME 2024·AIME 2025·AMC 2023(mean@16), MATH500·Minerva·OlympiadBench(mean@4), temperature 0.7, 최대 16,384 token. 1-shot 실험은 easy·medium·hard에서 각각 8개를 무작위로 뽑아 하나씩 따로 학습한다(총 24 run).
무작위로 뽑은 24개 예제 전부에서 1-shot OPD가 학생(42.4)을 올렸다. 가장 약한 예제도 48.0, 가장 강한 예제 {π973}은 51.7로 full-set 53.7에 근접한다.
| 모델 | AIME24 | AIME25 | AMC23 | MATH500 | Olympiad | Minerva | 평균 |
|---|---|---|---|---|---|---|---|
| 학생 (Base) | 31.7 | 23.0 | 60.7 | 82.6 | 34.1 | 22.4 | 42.4 |
| Teacher | 55.8 | 35.8 | 83.4 | 87.4 | 43.4 | 29.8 | 55.9 |
| Full-Set (17K) | 51.9 | 34.0 | 78.9 | 86.7 | 44.3 | 26.6 | 53.7 |
| Easy {π178} | 41.1 | 30.4 | 71.2 | 86.7 | 40.4 | 25.9 | 49.3 |
| Medium {π794} | 44.2 | 30.8 | 74.2 | 86.5 | 41.6 | 25.7 | 50.5 |
| Hard {π954} | 44.8 | 28.5 | 76.9 | 86.9 | 42.6 | 26.7 | 51.1 |
| Hard {π973} | 47.5 | 31.7 | 75.1 | 87.7 | 41.5 | 26.9 | 51.7 |
Easy 8개의 평균은 48.0–49.3, Medium 8개는 49.3–50.5, Hard 8개는 50.2–51.7로 구간이 거의 겹치지 않는다(전체 표는 논문 Table 1).


예제 하나로 학생이 teacher의 reasoning pattern을 배운다. 문제의 내용이 아니라 "Wait", "Alternatively" 같은 사고 구조가 옮겨진다
예제를 잘못 골라도 손해는 없다. 24개 전부 개선, 최소 +5.6%p
한 예제를 2,000 step 반복해도 안 무너진다. OPD의 dense한 KL 신호는 outcome reward와 달리 포화하지 않는다
세 난이도 구간에서 8개씩의 1-shot run을 평균하면 hard > medium > easy가 학습 내내 유지된다.

이 점이 RL과 갈린다. GRPO류에서는 학습 문제가 항상 맞거나(easy) 항상 틀리면(hard) group 안 advantage가 0이 되어 gradient가 없다. OPD는 결과가 아니라 token 분포 차이에서 신호를 얻으므로, teacher도 못 푸는 문제에서도 학생을 teacher 쪽으로 계속 옮긴다.
정답률이 0% 또는 100%면 학습 신호가 사라진다. 중간 난이도만 쓸 수 있다
학습 정확도와 무관하게 방문 state마다 teacher–student 격차가 있으면 신호가 있다. hard가 가장 좋다
RL 데이터 선택이 "풀 수 있을락말락"을 찾는다면, OPD 데이터 선택은 "어려울수록 좋다"로 간다
어려운 문제의 우위가 높은 token entropy 때문인지, 자연히 길어지는 CoT 때문인지 분리한다.
설정. 최대 rollout 길이를 두 문제 모두 99.5% 이상의 rollout이 잘리도록 낮게 고정한다. 그러면 두 문제의 학습 token 수가 거의 같아진다. 세 쌍: easy π178 vs hard π973(1K), medium π316 vs hard π954(2K), entropy가 크게 다른 hard 둘 π890 vs π948(4K).

| 비교 | 기본 설정(7,168 token) hard 우위 | 길이 통제 시 |
|---|---|---|
| {π973} vs {π178} (hard vs easy) | +3.9%p | +0.5%p (1K) |
| {π954} vs {π316} (hard vs medium) | +2.4%p | −0.9%p (2K) |
| {π890} vs {π948} (hard vs hard, entropy 상이) | — | 차이 없음 (4K) |
길이를 맞추면 우위가 사라진다. 보조 실험으로 easy π178을 높은 temperature로 rollout해 entropy만 올려도(Figure 7) 정확도는 오르지 않는다. entropy는 원인이 아니다.
hard {π954}로 최대 길이 2K·4K·7K에서 학습한 세 모델을 held-out 100문제·16 rollout에서 위치별 token KL로 비교한다.

같은 token 수로 자르면 hard의 우위가 0에 가깝다 → 원인은 token 수·길이
학습 CoT가 길수록 긴 위치에서의 KL이 낮다 → 긴 CoT가 long-horizon 정렬을 만든다
긴 CoT에서만 "Alternatively" 같은 반성·backtracking token이 KL 감소 상위에 들어온다 → 짧은 경로에는 없는 사고 패턴을 배운다
Section 4의 결론대로 hard만 골라 개수 $N\in\{1,4,8,16,64\}$를 늘린다. 1·4·8은 Table 1의 hard 예제({π973}, {π874, π890, π954, π973}, {π874…π997}), 16·64는 hard 풀에서 추가 무작위 추출. 비교로 easy 8개·medium 8개도 학습한다.
| 데이터 | 크기 | AIME24 | AIME25 | AMC23 | MATH500 | Olympiad | Minerva | 평균 |
|---|---|---|---|---|---|---|---|---|
| DAPO-Math-17K (Full-Set) | 17K | 51.9 | 34.0 | 78.9 | 86.7 | 44.3 | 26.6 | 53.7 |
| DAPO 무작위 subset | 1K | 50.2 | 34.8 | 79.3 | 87.1 | 42.8 | 27.3 | 53.6 |
| Easy 8개 | 8 | 45.8 | 30.6 | 76.1 | 87.1 | 41.6 | 26.2 | 51.2 |
| Medium 8개 | 8 | 49.0 | 32.7 | 76.8 | 86.8 | 42.1 | 26.0 | 52.2 |
| Hard {π973} | 1 | 47.5 | 31.7 | 75.1 | 87.7 | 41.5 | 26.9 | 51.7 |
| Hard 4개 | 4 | 50.8 | 31.5 | 78.5 | 86.7 | 41.5 | 28.2 | 52.9 |
| Hard 8개 | 8 | 51.7 | 34.2 | 79.2 | 87.2 | 42.7 | 26.4 | 53.6 |
| Hard 16개 | 16 | 49.4 | 33.3 | 78.5 | 87.7 | 43.0 | 27.7 | 53.3 |
| Hard 64개 | 64 | 50.2 | 36.7 | 79.1 | 87.8 | 42.7 | 27.1 | 53.9 |
두 가지가 읽힌다. hard를 1→8개로 늘리면 51.7→53.6으로 꾸준히 올라 8개에서 17K baseline(53.7)과 같아지고, 16·64개는 더 오르지 않는다. 같은 8개라도 hard(53.6) > medium(52.2) > easy(51.2)로 1-shot 결과와 일관된다.
같은 hard 1·4·8개로 세 쌍을 더 학습한다. Qwen3-4B는 thinking mode를 끈다.
| 학생 ← Teacher | 학생 | Teacher | Full-Set (17K) | Hard 1 | Hard 4 | Hard 8 |
|---|---|---|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B ← Skywork-OR1-Math-7B | 56.3 | 60.9 | 59.6 | 58.4 | 58.7 | 59.5 |
| Qwen3-1.7B-Base ← Qwen3-4B | 6.3 | 42.4 | 22.5 | 17.8 | 19.9 | 21.3 |
| Qwen3-4B-Base ← Qwen3-4B | 12.7 | 42.4 | 30.8 | 26.2 | 27.7 | 29.2 |
7B 학생은 1-shot만으로 58.4, 8-shot 59.5로 full-set 59.6과 같다. base 학생 둘은 8-shot이 full-set의 95% 안팎에 닿는다(21.3 vs 22.5, 29.2 vs 30.8). 규모·능력·backbone이 달라도 hard 8개라는 처방이 유지된다.
예제 1개로도 OPD가 되고(24/24 개선), 2,000 step을 돌려도 안 무너진다
hard > medium > easy. 학생·teacher 모두 못 풀어 학습 정확도 0%인 문제에서도 검증 정확도가 오른다
token entropy가 아니라 긴 CoT. 길이를 맞추면 hard의 우위(+3.9/+2.4%p)가 사라지고(+0.5/−0.9%p), 긴 CoT는 긴 horizon의 정렬과 반성 pattern을 만든다
hard만 골라 8개. 1.5B에서 53.6 vs 17K의 53.7, 7B에서 59.5 vs 59.6
핵심 메시지: OPD에서 좋은 데이터는 학생이 긴 CoT를 만들게 하는 어려운 문제이며, 그런 문제 8개가 17K와 같다.