通过截断推理自蒸馏学习部分链式思维
机器学习
2026-03-17 v1 人工智能
摘要
推理导向的语言模型通过在推理时生成长链式思维轨迹来实现卓越的性能。然而,这一能力伴随着 substantial 的计算成本,往往表现为冗余或低效的推理。我们研究了这一情境,提出了截断推理自蒸馏 (TRSD),这是一种轻量级的后训练程序,鼓励模型从部分推理轨迹中生成正确预测。在 TRSD 中,冻结的教师模型首先生成完整的推理轨迹并评估其对应的答案分布,基于提示和完整推理来构建合成训练目标。然后,使用相同体系结构的学生模型仅基于其推理轨迹的截断前缀来匹配教师的答案分布进行训练。在多个推理基准测试和 token 预算下,我们证明了 TRSD 能提高对截断推理的鲁棒性,在多样化的推理模型中显著降低准确率权衡。此外,尽管从未明确正则化以缩短生成,TRSD 训练的模型仍会本能地输出较短的推理轨迹而无需截断,显著降低推理时间成本,即使没有人工干预也是如此。
引用
@article{arxiv.2603.13274,
title = {Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation},
author = {Gianluigi Silvestri and Edoardo Cetin},
journal= {arXiv preprint arXiv:2603.13274},
year = {2026}
}