通过自适应前缀对齐进行长链推理蒸馏
计算与语言
2026-01-16 v1
摘要
大型语言模型(LLMs)已展现出卓越的推理能力,特别是在解决复杂数学问题方面。最近的研究表明,蒸馏长推理轨迹可以有效增强小规模学生模型的推理性能。然而,教师模型生成的推理轨迹往往过长且结构复杂,使得学生模型难以学习。这种不匹配导致了所提供的监督信号与学生模型的学习能力之间存在差距。为了解决这一挑战,我们提出了前缀对齐蒸馏(Prefix-ALIGNment distillation, P-ALIGN)框架,该框架通过自适应前缀对齐充分利用教师模型的思维链(CoTs)进行蒸馏。具体来说,P-ALIGN 通过判断剩余的后缀是否简洁且足以指导学生模型,来自适应地截断教师生成的推理轨迹。然后,P-ALIGN 利用教师生成的前缀来监督学生模型,鼓励有效的前缀对齐。在多个数学推理基准上的实验表明,P-ALIGN 的性能优于所有基线方法超过 3%。进一步的分析表明,P-ALIGN 构建的前缀提供了更有效的监督信号,同时避免了冗余和不确定推理成分的负面影响。所有代码可在 https://github.com/NEUIR/P-ALIGN 获取。
引用
@article{arxiv.2601.10064,
title = {Long-Chain Reasoning Distillation via Adaptive Prefix Alignment},
author = {Zhenghao Liu and Zhuoyang Wu and Xinze Li and Yukun Yan and Shuo Wang and Zulong Chen and Yu Gu and Ge Yu and Maosong Sun},
journal= {arXiv preprint arXiv:2601.10064},
year = {2026}
}