当链条跑偏时进行回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
计算与语言
2026-05-20 v1 人工智能
摘要
大型语言模型(LLM)通过长链式思维(CoT)在复杂推理任务中取得了显著进展,但其巨大的计算开销阻碍了实际部署。LLM推理蒸馏通过将推理能力从强大的教师模型转移到紧凑的学生模型来解决这一问题。然而,现有的蒸馏范式面临一个根本性的困境。典型的离策略蒸馏严格利用教师生成的黄金轨迹,由于训练分布与学生生成的推理上下文之间的差异,导致暴露偏差,从而在长CoT推理中引发错误级联。为解决这一问题,基于学生探索自身轨迹的策略虽然可以缓解上述问题,但我们展示它本质上会引入一种互惠的相反暴露偏差:当以学生生成的亚次优上下文为条件时,教师模型也难以提供积极的指导。为解决这一双重暴露偏差问题,我们提出了一种新的LLM推理蒸馏管道:监控轨迹并在跑偏时回溯(MOTAB)。具体而言,MOTAB动态监控学生的策略生成是否超过自适应安全边界。当生成跑偏并超过此阈值时,MOTAB会回溯到上一个安全状态,并利用教师干预来纠正方向。该方法本质上容忍学生的轻微错误以缓解暴露偏差,同时防止亚次优上下文绕过相反的暴露偏差。在LIMO-v2和AceReason数据集上的大量实验表明,MOTAB有效缓解了双重暴露偏差,在推理任务中实现了约3%的平均性能提升。
引用
@article{arxiv.2605.19433,
title = {Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation},
author = {Bing Wang and Shaotian Yan and Chen Shen and kaiyuan liu and Sinan Fan and Ximing Li and Rui Miao and Xiaosong Yuan and Zhanming Shen and Jieping Ye},
journal= {arXiv preprint arXiv:2605.19433},
year = {2026}
}
备注
26 pages, 8 figures