通过错误感知自我反思增强长链推理蒸馏
计算与语言
2025-10-15 v2
摘要
大型语言模型 展现出了强大的推理能力,并在数学问题求解任务中取得了卓越的性能。近期,从长格式思维链 中蒸馏推理能力已成为增强小型语言模型 的一种有前景的方法。现有研究通常将 SLM 作为学生模型,并使用长格式 CoT 作为监督微调 的监督信号以转移推理能力。然而,这类长格式 CoT 教师模型通常不了解学生模型的能力,这限制了对所提供推理轨迹的有效利用。为了克服这一限制,我们提出了错误感知自我反思 (ORION),这是一个通过错误感知反思过程来精炼教师 CoT 的框架。ORION 使学生模型能够通过精炼教师 CoT 并结合自身的推理错误,构建更量身定制的教师 CoT。在多个数学推理基准上的实验表明,ORION 相比所有基线持续提升了 2% 以上的性能。进一步分析表明,ORION 构建的 CoT 表现出更高的连贯性和逻辑一致性,从而作为更有效的 SFT 监督信号。所有代码可在 https://github.com/NEUIR/ORION.git 获取。
引用
@article{arxiv.2505.22131,
title = {Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection},
author = {Zhuoyang Wu and Xinze Li and Zhenghao Liu and Yukun Yan and Zhiyuan Liu and Minghe Yu and Cheng Yang and Yu Gu and Ge Yu and Maosong Sun},
journal= {arXiv preprint arXiv:2505.22131},
year = {2025}
}