通过电路引导的内部-外部差异检测非忠实链路思考
人工智能
2026-05-26 v1
摘要
链路思考(CoT)推理提升了大型语言模型(LLM)的问题解决能力,但生成的推理轨迹可能不忠实地反映模型的实际决策过程。现有CoT非忠实检测器主要依赖生成理由的外部信号,如文本合理性或答案一致性,忽略了模型内部计算的证据。虽然最近的电路追踪方法通过追踪推理期间信息如何通过模型组件流动来获取模型内部证据,但为长CoT构建完整电路代价高昂且难以扩展。为此,我们提出了电路引导的内部-外部差异评分器(CIE-Scorer),用于实例级CoT非忠实检测。其核心思想是,忠实的推理轨迹应与模型的计算过程一致,而非忠实的轨迹可能与之偏离。CIE-Scorer高效地从信息丰富的推理标记中追踪紧凑的句子级电路,构建内部与外部推理图谱,并使用融合戈尔巴赫-沃尔泰斯坦距离衡量其差异。在FaithCoT-Bench上的四个数据集实验中,CIE-Scorer在降低电路构建成本的同时实现了最佳性能,证明了将机制可解释性信号与外部推理轨迹结合用于CoT非忠实检测的有效性。
引用
@article{arxiv.2605.25603,
title = {Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy},
author = {Xu Shen and Zhen Tan and Song Wang and Pingjun Hong and Rui Miao and Xin Wang and Tianlong Chen},
journal= {arXiv preprint arXiv:2605.25603},
year = {2026}
}