中文

绕过依据:语言模型中隐式推理的因果审计

机器学习 2026-02-10 v2 人工智能

摘要

链式思维(CoT)提示法在实际应用中被广泛用作推理辅助手段,常被当作透明性机制来对待。然而,CoT 带来的行为提升并不意味着模型的内部计算在因果上依赖于产生的推理文本,即模型可能在生成流畅的论证文本的同时,将关键决策计算路由到隐蔽的路径中。我们引入一种基于激活拼接的因果、层级审计方法,以衡量 CoT 的忠诚度。我们的关键指标——CoT 中介指数(CMI)——通过将 CoT 标记隐藏状态的性能下降与匹配对照拼接进行比较,从而隔离出 CoT 特有的因果影响。我们在多个模型家族(Phi、Qwen、DialoGPT)和不同规模的模型中发现,CoT 特有的影响通常局限于狭窄的“推理窗口”,并识别出在 CMI 虽然接近零却仍具备可信 CoT 文本的“绕过”情形。我们进一步观察到,明确针对推理进行调优的模型比更大规模的未调优模型表现出更强且更结构化的中介作用,而混合专家模型则表现出更为分散的中介模式,这与路由式计算相吻合。总体而言,我们的结果表明,CoT 的忠诚度在不同模型和任务之间存在显著差异,不能仅凭行为推断,此致于在将 CoT 作为透明信号使用时,需要进行因果、层级审计。

关键词

引用

@article{arxiv.2602.03994,
  title  = {Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models},
  author = {Anish Sathyanarayanan and Aditya Nagarsekar and Aarush Rathore},
  journal= {arXiv preprint arXiv:2602.03994},
  year   = {2026}
}

备注

Under Review at ICLR, 2026