시범 답안을 그대로 모방하지 않고, 시범을 읽은 자기 모델을 교사로 삼아 학생이 생성한 경로에서 학습. 새로운 능력 습득과 기존 능력 보존을 함께 평가하는 SDFT.
보상 함수 없이 시범으로 on-policy 학습. 시범을 읽은 자기 모델을 교사로 사용하고 학생 생성 경로에서 token별 피드백 수집.
| 선행연구 | 접근 | SDFT의 선택 |
|---|---|---|
| Ross et al., DAgger (2011) · Agarwal et al., GKD (2024) | 학생이 방문한 상태에서 감독 | 외부 전문가 대신 시범 조건부 자기 모델 |
| Inverse RL | 시범으로 reward를 추정한 뒤 RL | 별도 reward 학습 없이 교사 분포 사용 |
| Bai et al. · Snell et al., context distillation (2022) | 추가 문맥의 정보를 학생에게 증류 | 질문별 시범과 현재 학생 rollout 사용 |
학생 $P_\theta$는 질문 $x$만, 교사 $Q_\phi$는 시범 $c$도 확인. 학습 경로는 학생이 생성.
Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal. 기재 소속은 MIT, Improbable AI Lab, ETH Zurich. Shenfeld가 프로젝트를 주도하고 Agrawal이 연구 방향을 공동 설계. Hübotter는 알고리즘·실험 설계, Damani는 실험 설계와 작성에 기여.
ICML 2026 본학회 채택이며 저자 발표 목록에는 Spotlight로 표기. ICLR 2026 Lifelong Agents 워크숍 발표와 구분. 본 자료는 2026-08-07 개정된 arXiv v2 기준. 최초 공개일은 2026-01-27, 자료 확인일은 2026-09-07.
논문 v2 · PDF · ICML 공식 목록 · 저자 발표 목록 · 프로젝트
보상 함수 없이 학생 생성 답변을 학습에 사용. 시범을 읽은 교사가 학생 답변의 각 token을 평가하는 방식.
| 방법 | 학습 경로 | 감독 신호 |
|---|---|---|
| 일반 SFT | 고정 시범 답안 | 정답 토큰 |
| Teacher-sample SFT | 교사가 생성한 답안 | 정답 토큰 |
| SDFT | 현재 학생이 생성한 경로 | 시범 조건부 교사의 토큰 분포 |
| 보상 기반 RL | 현재 정책이 생성한 경로 | 명시적 reward |
외부의 더 큰 교사는 필요하지 않음. 하지만 유용한 시범과 이를 해석할 모델 능력까지 필요 없는 것은 아님.

학생은 질문 $x$로 답변 생성. 교사는 시범 $c$까지 보면서 학생이 실제 방문한 동일한 prefix의 다음 토큰 평가. 학생은 학습 후 추론 때 시범을 받지 않음. 단순히 추론 문맥에 예시를 유지하는 ICL과 달리 파라미터에 적응 결과 보존.
교사 출력은 target이며, 교사를 student loss의 역전파 대상으로 함께 최적화하지 않음. 교사 가중치는 EMA로 갱신.
KL 방향은 학생에서 교사. 하지만 sequence-level 목적함수와 구현의 gradient estimator를 동일시하면 불가. 초기 토큰이 이후 방문 상태에 주는 영향까지 미분하는지에 따라 추정기가 변화.
구현은 analytic per-token 추정기 사용. Sequence-level gradient와의 차이·추정기 비교는 부록 A.1 참조.
학생과 교사를 같은 checkpoint로 시작.
질문과 시범의 minibatch를 sampling.
학생 문맥으로 prompt당 하나의 답변 생성.
학생과 시범 조건부 교사의 토큰 분포 비교.
선택한 증류 gradient 추정기로 학생을 갱신.
교사를 학생의 이동평균으로 갱신하고 새 rollout으로 반복.
이 식의 $\alpha$는 새 학생 가중치. EMA 설정별 비교는 부록 A.3 참조.
Trust-region / inverse-RL 해석의 두 조건: 교사의 높은 과제 성공률과 현재 정책으로부터의 작은 변화. ToolAlpaca 진단의 교사 성공률 100%, base까지의 KL 0.68 nats. SFT의 KL 1.26보다 작은 변화.
이는 특정 설정의 관찰. 어떤 시범에서도 최적 교사가 만들어진다는 증명이나, KL이 작으면 모든 지식이 보존된다는 보장이 아님.
기본 모델 Qwen2.5-7B-Instruct. 방법별 target validation 최고 checkpoint 선택 후 held-out test 평가.
| 과제 | 학습·평가 대상 |
|---|---|
| Science | SciKnowEval Chemistry L-3의 학부 수준 과학 문답 |
| Tool use | ToolAlpaca의 API 명세·사용자 요청에 맞는 도구 호출 |
| Medical | HuatuoGPT-o1 stage 1 학습, stage 2 평가 |
| 기존 능력 | HellaSwag·HumanEval·IFEval·MMLU·TruthfulQA·Winogrande 평균 |

SFT는 새 과제 향상과 함께 기존 능력 하락. DFT는 importance weighting으로 off-policy 데이터를 보정하나 잔여 망각 발생. Re-invocation은 SFT 뒤 일반 prompt에서 base 교사로 추가 증류해 일부 능력 복구. SDFT는 새 과제 향상과 기존 평균 보존에서 가장 유리한 위치.
평균 보존과 개별 benchmark 보존은 구분. 개별 점수·학습 설정은 부록 B 참조.


이 세 단계 결과를 무기한 작업이 추가되는 lifelong learning 보장으로 확대하지 않음.
저자들은 base 학습 cutoff 이후 사실로 설명하는 2025년 자연재해 기사 약 20만 토큰과 파생 QA 사용. 이는 논문의 실험 전제이며 본 자료가 사전학습 데이터 오염을 독립 검증한 것은 아님.
| 방법 | 엄격 정확도 (%) | 완화 정확도 (%) | 간접 질문 OOD (%) |
|---|---|---|---|
| Base | 0 | 0 | 0 |
| Oracle RAG | 91 | 100 | 100 |
| CPT | 9 | 37 | 7 |
| SFT | 80 | 95 | 80 |
| SDFT | 89 | 100 | 98 |
원문 Table 1. Base의 세 지표 모두 0. CPT는 9·37·7%로 제한적인 사실 습득. SFT의 80·95·80% 대비 SDFT는 89·100·98%. Strict는 모든 세부사항의 정답, lenient는 옳은 정보 포함과 잘못된 진술 없음, OOD는 사실을 직접 언급하지 않는 간접 질문 기준.
Oracle RAG는 추론 때 정답 기사를 제공받는 상한 비교. SDFT는 추론 때 기사 미제공. 교사 문맥 구성의 추가 비교는 부록 A.2 참조.
| OLMo-3-7B-Think 의료 적응 | 정확도 (%) | 평균 생성 토큰 |
|---|---|---|
| Base | 31.2 | 4612 |
| SFT | 23.5 | 3273 |
| SDFT | 43.7 | 4180 |
원문 Table 2. 시범에 명시적 추론 과정은 없음. SFT는 짧은 답안을 직접 모방하면서 기존 생성 패턴과 성능이 약해지는 반면, SDFT는 조건부 교사를 통해 적응. 응답 길이는 행동 proxy이지 추론의 충실성이나 정당성 증명이 아님.
Science Q&A에서 Qwen2.5 3B·7B·14B의 SFT와 SDFT 비교. 모델 크기 변화에 따른 시범 조건부 교사 능력 점검.


단일 sampling 확률을 높이는 sharpening만으로 설명하기 어려운 결과. 다른 과제·모든 모델의 pass@128 보장을 뜻하는 결과는 아님.
Tool use에서 동일한 시범 조건부 교사 사용. Standard SFT, 교사 생성 답안의 SFT, 고정 교사 데이터의 offline KL distillation, 학생 rollout의 SDFT 비교.

좋은 교사의 존재와 학생 경로에서의 감독은 별도 요인. 교사를 고정한 비교에서도 on-policy 경로의 추가 이득 확인.
저자들은 일반 SFT보다 약 2.5배 FLOPs, 약 4배 wall-clock 시간 보고. 단일 NVIDIA H200에서 full-parameter tuning으로 실험. 이 수치는 GPU나 구현에 관계없이 유지되는 상수가 아님.
논문 v2, 모델 revision, 데이터 분할과 평가 프롬프트를 기록.
업데이트 횟수뿐 아니라 생성·교사 평가를 포함한 비용 비교.
새 과제, 기존 평가 개별 점수, 평균과 순차 학습 구분.
KL 추정기, teacher EMA, prefix scoring, token masking, 추론 문맥 공개.
On-policy라는 이름만으로 지식 보존을 보장할 수는 없음. 시범 품질, ICL 능력, 교사 갱신과 목적함수가 모두 중요.
시범을 target sequence가 아니라 교사를 더 잘 알게 만드는 정보로 사용. 학생의 실제 생성 경로에서 조건부 교사와 맞추면 평가한 설정에서 새 과제 학습과 기존 능력 보존을 함께 개선.
핵심 조건: 유용하고 가까운 교사, 현재 학생 경로, 안정적인 업데이트. 계산 비용과 개별 능력 하락을 포함한 성능 평가.
그림 2·3a·3b·4·5(좌·우)·6: Shenfeld et al., arXiv:2601.19897v2, CC BY 4.0. SVG의 PNG 변환, 데이터·레이블 유지. 기존 그림 출처 · 추가 실험 그림 출처 · 원문