忠实性即信息流:评估与训练忠实的思维链推理
机器学习
2026-05-26 v1 计算与语言
摘要
思维链(CoT)推理只有在推理轨迹忠实反映产生最终答案的计算过程时,才对监控语言模型有用。然而,模型可能依赖绕过CoT的提示到答案捷径,使得可见的推理轨迹即使看似合理也具有误导性。我们通过结构化的信息流视角研究CoT的忠实性:忠实的推理应将与答案相关的信息通过从提示到CoT再到答案的中介路径路由,而非通过直接的提示到答案捷径。这一视角产生了一个基于三个互补属性——充分性、完备性和必要性——的任务无关框架,我们分别用基于熵、掩蔽KL和基于梯度的诊断方法对其进行实例化。我们表明,这些指标能够恢复在提示推理中外部判断的忠实性差异,并识别出KL诊断中低熵失效模式,而基于梯度的度量在此情况下保持更稳定。基于此分析,我们引入了用于基于验证器的在策略强化学习的更新时干预,包括注意力掩蔽、仅反向梯度掩蔽、CoT梯度和提示表示的对抗扰动。在提示算术、可奖励黑客的代码修复以及在没有提示但通过错误提示注入评估的DAPO-Math模型中,我们的干预将行为和结构指标转向更强的CoT中介。特别是,它们使捷径和奖励黑客行为在CoT中更加透明,并改善了任务无关的忠实性指标,同时在部分设置中还降低了对错误提示的敏感性。我们的结果表明,在训练期间控制信息流是通往更忠实和可监控的CoT推理的实用途径。代码可在 https://github.com/safety-research/faithful-cot 获取。
引用
@article{arxiv.2605.24286,
title = {Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning},
author = {Jinghan Jia and Joe Benton and Eric Easley},
journal= {arXiv preprint arXiv:2605.24286},
year = {2026}
}