推理剧场: disentangling 模型信念与链路思考
计算与语言
2026-05-29 v4 人工智能
机器学习
摘要
我们提供了对链路思考 (CoT) 中表演性链路思考的证据,表明模型在最终答案取得高度自信后,仍持续生成标记而不透露其内部信念。我们的分析比较了激活探测、早期强制答题以及 CoT 监视器,在两个大型模型 (DeepSeek-R1 671B 与 GPT-OSS 120B) 上进行,发现任务难度相关差异:尤其对于容易的记忆类 MMLU 题目,模型的最终答案可从激活中更早时刻解码,而监视器尚无法作出判断。我们与此相对的是对困难多跳 GPQA-Diamond 题目中真正推理的分析。尽管如此,突出点(如回溯、'啊哈'时刻)几乎只出现在探测器显示大信念转变的响应中,这表明这些行为几乎完全跟踪真实的不确定性而非学习的“表演性推理”。最后,探针引导的早期退出在 MMLU 上可减少最高达 80% 的标记,在 GPQA-Diamond 上可减少 30%,同时保持类似准确率,这将注意力探测定位为检测表演性推理并实现自适应计算的高效工具。
引用
@article{arxiv.2603.05488,
title = {Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought},
author = {Siddharth Boppana and Annabel Ma and Max Loeffler and Raphael Sarfati and Eric Bigelow and Atticus Geiger and Owen Lewis and Jack Merullo},
journal= {arXiv preprint arXiv:2603.05488},
year = {2026}
}