MIT · IMPROBABLE AI LAB · ETH ZURICH

Self-Distillation Enables Continual Learning

시범 답안을 그대로 모방하지 않고, 시범을 읽은 자기 모델을 교사로 삼아 학생이 생성한 경로에서 학습. 새로운 능력 습득과 기존 능력 보존을 함께 평가하는 SDFT.

arXiv2601.19897v2
상태ICML 2026 main conference
게재2026-01-27
저자Idan Shenfeld 외 3명
분야cs.LG · Continual Learning
원문PDF ↗
ICML 2026
본학회 채택 · 저자 발표 목록상 Spotlight
70.2 / 66.2
Science 정확도: SDFT / SFT (%)
64.5 / 53.4
Science 학습 뒤 기존 평가 평균: SDFT / SFT (%)
2.5× / 4×
SFT 대비 보고된 FLOPs / 학습 시간 비용
01BACKGROUND

문제·동기·기존 연구

보상 함수 없이 시범으로 on-policy 학습. 시범을 읽은 자기 모델을 교사로 사용하고 학생 생성 경로에서 token별 피드백 수집.

선행연구접근SDFT의 선택
Ross et al., DAgger (2011) · Agarwal et al., GKD (2024)학생이 방문한 상태에서 감독외부 전문가 대신 시범 조건부 자기 모델
Inverse RL시범으로 reward를 추정한 뒤 RL별도 reward 학습 없이 교사 분포 사용
Bai et al. · Snell et al., context distillation (2022)추가 문맥의 정보를 학생에게 증류질문별 시범과 현재 학생 rollout 사용
$$ \min_\theta\ \mathbb E_{y\sim P_\theta}\sum_t D_{\mathrm{KL}}\!\left(P_\theta(\cdot\mid h_t,x)\,\|\,Q_\phi(\cdot\mid h_t,x,c)\right) $$

학생 $P_\theta$는 질문 $x$만, 교사 $Q_\phi$는 시범 $c$도 확인. 학습 경로는 학생이 생성.

원문 §1–§3 · DAgger · GKD

02PROVENANCE

저자·연구 그룹·논문 버전

Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal. 기재 소속은 MIT, Improbable AI Lab, ETH Zurich. Shenfeld가 프로젝트를 주도하고 Agrawal이 연구 방향을 공동 설계. Hübotter는 알고리즘·실험 설계, Damani는 실험 설계와 작성에 기여.

ICML 2026 본학회 채택이며 저자 발표 목록에는 Spotlight로 표기. ICLR 2026 Lifelong Agents 워크숍 발표와 구분. 본 자료는 2026-08-07 개정된 arXiv v2 기준. 최초 공개일은 2026-01-27, 자료 확인일은 2026-09-07.

논문 v2 · PDF · ICML 공식 목록 · 저자 발표 목록 · 프로젝트

03QUESTION

보상 함수 없이 on-policy 학습하기

보상 함수 없이 학생 생성 답변을 학습에 사용. 시범을 읽은 교사가 학생 답변의 각 token을 평가하는 방식.

방법학습 경로감독 신호
일반 SFT고정 시범 답안정답 토큰
Teacher-sample SFT교사가 생성한 답안정답 토큰
SDFT현재 학생이 생성한 경로시범 조건부 교사의 토큰 분포
보상 기반 RL현재 정책이 생성한 경로명시적 reward

외부의 더 큰 교사는 필요하지 않음. 하지만 유용한 시범과 이를 해석할 모델 능력까지 필요 없는 것은 아님.

04METHOD

같은 모델, 서로 다른 정보

원문 Figure 2. 학생은 질문만, 교사는 질문과 시범을 수신. 오른쪽은 ToolAlpaca에서 base policy와의 거리를 비교한 결과. 이 한 실험으로 KL과 망각의 보편적 관계가 입증되지는 않음.

학생은 질문 $x$로 답변 생성. 교사는 시범 $c$까지 보면서 학생이 실제 방문한 동일한 prefix의 다음 토큰 평가. 학생은 학습 후 추론 때 시범을 받지 않음. 단순히 추론 문맥에 예시를 유지하는 ICL과 달리 파라미터에 적응 결과 보존.

$$ P_\theta(v\mid h_t,x),\qquad Q_\phi(v\mid h_t,x,c) $$

교사 출력은 target이며, 교사를 student loss의 역전파 대상으로 함께 최적화하지 않음. 교사 가중치는 EMA로 갱신.

05OBJECTIVE

Reverse KL과 gradient 추정기의 차이

$$ \mathcal L(\theta)=\mathbb E_{(x,c),y\sim P_\theta}\left[\sum_t D_{\mathrm{KL}}\left(P_\theta(\cdot\mid h_t,x)\,\|\,Q_\phi(\cdot\mid h_t,x,c)\right)\right] $$

KL 방향은 학생에서 교사. 하지만 sequence-level 목적함수와 구현의 gradient estimator를 동일시하면 불가. 초기 토큰이 이후 방문 상태에 주는 영향까지 미분하는지에 따라 추정기가 변화.

구현은 analytic per-token 추정기 사용. Sequence-level gradient와의 차이·추정기 비교는 부록 A.1 참조.

06ALGORITHM

실제 학습 루프와 EMA 교사

초기화

학생과 교사를 같은 checkpoint로 시작.

데이터 선택

질문과 시범의 minibatch를 sampling.

Student rollout

학생 문맥으로 prompt당 하나의 답변 생성.

같은 prefix 평가

학생과 시범 조건부 교사의 토큰 분포 비교.

학생 업데이트

선택한 증류 gradient 추정기로 학생을 갱신.

Teacher EMA

교사를 학생의 이동평균으로 갱신하고 새 rollout으로 반복.

$$ \phi\leftarrow\alpha\theta+(1-\alpha)\phi $$

이 식의 $\alpha$는 새 학생 가중치. EMA 설정별 비교는 부록 A.3 참조.

07MECHANISM

교사가 더 유용하면서 가까운가?

Trust-region / inverse-RL 해석의 두 조건: 교사의 높은 과제 성공률과 현재 정책으로부터의 작은 변화. ToolAlpaca 진단의 교사 성공률 100%, base까지의 KL 0.68 nats. SFT의 KL 1.26보다 작은 변화.

이는 특정 설정의 관찰. 어떤 시범에서도 최적 교사가 만들어진다는 증명이나, KL이 작으면 모든 지식이 보존된다는 보장이 아님.

08RESULTS

새 과제 성능과 기존 능력

기본 모델 Qwen2.5-7B-Instruct. 방법별 target validation 최고 checkpoint 선택 후 held-out test 평가.

과제학습·평가 대상
ScienceSciKnowEval Chemistry L-3의 학부 수준 과학 문답
Tool useToolAlpaca의 API 명세·사용자 요청에 맞는 도구 호출
MedicalHuatuoGPT-o1 stage 1 학습, stage 2 평가
기존 능력HellaSwag·HumanEval·IFEval·MMLU·TruthfulQA·Winogrande 평균
Figure 4. 새 과제 정확도와 기존 능력 평균의 동시 비교. Base·SFT·DFT·SFT+Re-invocation·SDFT 포함.

SFT는 새 과제 향상과 함께 기존 능력 하락. DFT는 importance weighting으로 off-policy 데이터를 보정하나 잔여 망각 발생. Re-invocation은 SFT 뒤 일반 prompt에서 base 교사로 추가 증류해 일부 능력 복구. SDFT는 새 과제 향상과 기존 평균 보존에서 가장 유리한 위치.

평균 보존과 개별 benchmark 보존은 구분. 개별 점수·학습 설정은 부록 B 참조.

09CONTINUAL

세 과제를 순서대로 학습하면

원문 Figure 3a: SDFT. 동일한 모델이 세 기술을 차례로 배우는 동안 이전 기술의 성능 추적.
원문 Figure 3b: SFT. 과제가 바뀌면 이전 성능이 떨어지는 간섭이 관찰. 두 그림의 y축은 정규화 점수. 0은 base, 1은 두 방법에서 얻은 최고 점수이며 실제 정확도 %가 아님.

이 세 단계 결과를 무기한 작업이 추가되는 lifelong learning 보장으로 확대하지 않음.

10KNOWLEDGE

새 사실 주입과 Oracle RAG

저자들은 base 학습 cutoff 이후 사실로 설명하는 2025년 자연재해 기사 약 20만 토큰과 파생 QA 사용. 이는 논문의 실험 전제이며 본 자료가 사전학습 데이터 오염을 독립 검증한 것은 아님.

방법엄격 정확도 (%)완화 정확도 (%)간접 질문 OOD (%)
Base000
Oracle RAG91100100
CPT9377
SFT809580
SDFT8910098

원문 Table 1. Base의 세 지표 모두 0. CPT는 9·37·7%로 제한적인 사실 습득. SFT의 80·95·80% 대비 SDFT는 89·100·98%. Strict는 모든 세부사항의 정답, lenient는 옳은 정보 포함과 잘못된 진술 없음, OOD는 사실을 직접 언급하지 않는 간접 질문 기준.

Oracle RAG는 추론 때 정답 기사를 제공받는 상한 비교. SDFT는 추론 때 기사 미제공. 교사 문맥 구성의 추가 비교는 부록 A.2 참조.

11ANSWER-ONLY

정답만 있는 데이터로 추론 모델 적응

OLMo-3-7B-Think 의료 적응정확도 (%)평균 생성 토큰
Base31.24612
SFT23.53273
SDFT43.74180

원문 Table 2. 시범에 명시적 추론 과정은 없음. SFT는 짧은 답안을 직접 모방하면서 기존 생성 패턴과 성능이 약해지는 반면, SDFT는 조건부 교사를 통해 적응. 응답 길이는 행동 proxy이지 추론의 충실성이나 정당성 증명이 아님.

12FIGURE 5

모델 크기와 반복 sampling

Science Q&A에서 Qwen2.5 3B·7B·14B의 SFT와 SDFT 비교. 모델 크기 변화에 따른 시범 조건부 교사 능력 점검.

Figure 5 왼쪽. 3B에서는 SDFT가 SFT보다 낮은 성능. 7B는 약 4%p, 14B는 약 7%p 우세. 작은 모델의 약한 ICL이 실패 조건.
Figure 5 오른쪽. Tool use의 Base·SFT·SDFT를 k=128까지 pass@k로 평가. 큰 k에서도 SDFT 우세 유지.

단일 sampling 확률을 높이는 sharpening만으로 설명하기 어려운 결과. 다른 과제·모든 모델의 pass@128 보장을 뜻하는 결과는 아님.

13FIGURE 6

같은 교사에서 학습 경로만 변경

Tool use에서 동일한 시범 조건부 교사 사용. Standard SFT, 교사 생성 답안의 SFT, 고정 교사 데이터의 offline KL distillation, 학생 rollout의 SDFT 비교.

Figure 6. 교사 답안의 offline 학습은 Standard SFT보다 개선되지만 on-policy SDFT에는 미달.

좋은 교사의 존재와 학생 경로에서의 감독은 별도 요인. 교사를 고정한 비교에서도 on-policy 경로의 추가 이득 확인.

14LIMITATIONS

비용과 재현 체크포인트

저자들은 일반 SFT보다 약 2.5배 FLOPs, 약 4배 wall-clock 시간 보고. 단일 NVIDIA H200에서 full-parameter tuning으로 실험. 이 수치는 GPU나 구현에 관계없이 유지되는 상수가 아님.

버전 고정

논문 v2, 모델 revision, 데이터 분할과 평가 프롬프트를 기록.

비용 맞추기

업데이트 횟수뿐 아니라 생성·교사 평가를 포함한 비용 비교.

점수 분리

새 과제, 기존 평가 개별 점수, 평균과 순차 학습 구분.

구현 명시

KL 추정기, teacher EMA, prefix scoring, token masking, 추론 문맥 공개.

On-policy라는 이름만으로 지식 보존을 보장할 수는 없음. 시범 품질, ICL 능력, 교사 갱신과 목적함수가 모두 중요.

15TAKEAWAY

정리

시범을 target sequence가 아니라 교사를 더 잘 알게 만드는 정보로 사용. 학생의 실제 생성 경로에서 조건부 교사와 맞추면 평가한 설정에서 새 과제 학습과 기존 능력 보존을 함께 개선.

핵심 조건: 유용하고 가까운 교사, 현재 학생 경로, 안정적인 업데이트. 계산 비용과 개별 능력 하락을 포함한 성능 평가.

그림 2·3a·3b·4·5(좌·우)·6: Shenfeld et al., arXiv:2601.19897v2, CC BY 4.0. SVG의 PNG 변환, 데이터·레이블 유지. 기존 그림 출처 · 추가 실험 그림 출처 · 원문

Thank You!