是什么让思维链在探测时有效?局部共现而非全局推导
人工智能
2026-05-27 v1
摘要
思维链(CoT)提示可靠地提高了语言模型的准确性,但推理文本的哪些属性推动了这种改进尚不清楚。先前的工作主要研究了生成时的行为。我们转而提出一个探测时的问题:给定上下文中的一个固定推理,该文本中的什么改变了答案?我们确定了增益的两个互补来源。首先,即使是全局词序打乱的推理也显著优于无推理基线,表明存在强烈的词汇激活效应。更重要的是,结构化文本带来的额外增益似乎较少来自句子级别的逻辑排序,而更多来自短距离的标记邻接。仅保留--个标记的连续窗口就能恢复朝向完整CoT性能的大部分剩余增益。支持性实验排除了复制显式答案声明或答案值,以及完整的语法实现作为主要驱动因素。进一步的泛化实验表明,这种定性模式在多个模型家族、参数规模和数据集上保持稳定。这些结果支持探测时CoT的局部共现激活(LCA)解释,其中观察到的增益似乎主要来自词汇激活和短距离标记共现,而非句子级别的逻辑推导。
引用
@article{arxiv.2605.26795,
title = {What Makes Chain-of-Thought Work at Probe Time? Local Co-occurrence Rather Than Global Derivation},
author = {Xiang Wang and Wei Wei},
journal= {arXiv preprint arXiv:2605.26795},
year = {2026}
}