如何微调推理模型?基于教师-学生合作框架合成学生一致的监督微调数据
计算与语言
2026-04-22 v2
摘要
模型增强的常用策略是使用由更强模型生成的合成数据进行监督式微调(SFT)。然而,对于像 Qwen3-8B 这类新兴推理模型而言,这种方法常常无法提升推理能力,甚至可能导致性能显著下降。本文我们识别到,教师生成数据与学生数据分布之间的显著风格差异是影响SFT效果的主要因素之一。为弥合这一差距,我们提出了教师-学生合作数据生成框架(TESSY),该框架交替使用教师和学生模型生成风格与非风格 token。因此,TESSY 生成的合成序列既继承了教师的先进推理能力,又保持了与学生数据分布的风格一致性。在GPT-OSS-120B作为教师模型进行代码生成实验中,基于教师生成数据的微调导致Qwen3-8B在LiveCodeBench-Pro和OJBench上分别出现3.25%和10.02%的性能下降,而TESSY实现了11.25%和6.68%的提升。
引用
@article{arxiv.2604.14164,
title = {How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data},
author = {Zixian Huang and Kaichen Yang and Xu Huang and Feiyang Hao and Qiming Ge and Bowen Li and He Du and Kai Chen and Qipeng Guo},
journal= {arXiv preprint arXiv:2604.14164},
year = {2026}
}