以学生自己的语言:为小型模型定制的推理轨迹使其成为更好的推理者
计算与语言
2025-09-29 v1
摘要
通过监督微调将推理能力从大型语言模型迁移到较小模型时,往往事与愿违,尽管可以访问高质量的教师示范,性能反而下降。我们发现这一失败源于分布不对齐:大型模型的推理轨迹包含学生分布下低概率的标记,超出了较小架构的内部表示容量,形成了学习障碍而非有益指导。我们提出了反向推测解码(RSD),一种生成对学生友好的推理轨迹的机制,其中教师模型提出候选标记,但学生模型根据自身概率分布决定接受与否,过滤低概率标记。当应用于Qwen3-0.6B时,直接蒸馏s1K-1.1推理轨迹数据使主要推理基准上的平均性能下降20.5%,而使用RSD生成的推理轨迹训练的同一模型实现了4.9%的显著提升。我们的分析表明,低概率标记构成了推理能力迁移的关键瓶颈。然而,跨模型实验表明RSD轨迹是模型特定的而非普遍适用的,这意味着分布对齐必须针对每个学生架构独特的内部表示进行定制。
引用
@article{arxiv.2509.22230,
title = {In Their Own Words: Reasoning Traces Tailored for Small Models Make Them Better Reasoners},
author = {Jaehoon Kim and Kwangwook Seo and Dongha Lee},
journal= {arXiv preprint arXiv:2509.22230},
year = {2025}
}