链路思考破坏研究中的终端词常胜:一种格式混淆现象
机器学习
2026-05-18 v2 人工智能
计算与语言
摘要
破坏性研究是评估链路思考(CoT)忠诚度的标准工具,通过破坏链条中的步骤来推断哪些步骤“计算上重要”。我们展示,当基准链以显式终端答案行结束时(如 GSM8K 和 MATH),这些测试大多测量的是“答案置放”而非中间计算是在何处完成的。使用匹配的 GSM8K 示例,仅移除最终答案语句而保留所有推理,使后缀灵敏度约降低 倍(Qwen~2.5-3B,,)。包含正确推理但错误显式最终答案的冲突答案提示,在 7B 参数跨五个开源模型家族中将准确率压至零或接近零;在 3B-7B 参数规模下,错误答案跟随现象显著,而在更大规模下则迅速衰减。对 MATH 的复现、7B 参数下的稳态比较以及无后缀链的实验显示相同模式在不同形式下均成立:破坏灵敏度跟随显式答案文本的位置,而非推理中的固定计算深度。生成时探针表明最终答案极少在生成早期即被确定( 早期确定),但消耗时行为却系统性地遵循显式答案文本。这一混淆现象基本上是链条被消费时的读出效应。我们提出三项先决条件协议(仅问题控制、格式特征化、全位置扫描)作为未来基于破坏的忠诚度研究的实用最低要求。
引用
@article{arxiv.2605.10799,
title = {The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies},
author = {Gabriel Garcia},
journal= {arXiv preprint arXiv:2605.10799},
year = {2026}
}
备注
34 pages, 6 figures, 13 tables. Submitted to NeurIPS 2026. Code and data: https://github.com/Gpgabriel25/LastWordWinsCoT