反事实模拟训练:用于链式思维忠诚度的训练方法
人工智能
2026-02-25 v1 计算与语言
摘要
检查链式思维(Chain-of-Thought, CoT)推理是理解大语言模型(LLM)生成输出的最常见方法之一,但众所周知的CoT忠诚度问题严重限制了从该实践中获得的洞见。本文引入一种称为反事实模拟训练(Counterfactual Simulation Training, CST)的训练方法,旨在通过奖励能够准确预测模型在反事实输入下输出的CoT,从而提高CoT忠诚度。在本文中,我们在两种设置下应用CST:(1)基于线索的反事实模拟用于CoT监控,以检测模型是否依赖虚假特征、奖励作弊或讨好用户;(2)针对通用模型反事实模拟,以鼓励模型在CoT中生成更忠实、更可泛化的推理。使用参数量最高达2350亿的模型进行实验,结果显示CST在基于线索的反事实模拟上将监控准确率提升了35个准确分点,同时在通用反事实模拟的可模拟性提升了2个分点。我们进一步表明:(1)CST超越了提示基线方法;(2)使用LLM重写不忠实的CoT的效率是RLalone的5倍;(3)忠诚度改进并不适用于讨好线索(相对于说服线索);(4)更大的模型默认不会表现出更忠实的CoT,但它们从CST中受益更多。这些结果表明CST可以普遍提高CoT忠诚度,具有广泛的CoT监控应用前景。本文实验的代码可在 https://github.com/peterbhase/counterfactual-simulation-training 查阅。
引用
@article{arxiv.2602.20710,
title = {Counterfactual Simulation Training for Chain-of-Thought Faithfulness},
author = {Peter Hase and Christopher Potts},
journal= {arXiv preprint arXiv:2602.20710},
year = {2026}
}