中文

是什么让思维链在探测时有效?局部共现而非全局推导

人工智能 2026-05-27 v1

摘要

思维链(CoT)提示可靠地提高了语言模型的准确性,但推理文本的哪些属性推动了这种改进尚不清楚。先前的工作主要研究了生成时的行为。我们转而提出一个探测时的问题:给定上下文中的一个固定推理,该文本中的什么改变了答案?我们确定了增益的两个互补来源。首先,即使是全局词序打乱的推理也显著优于无推理基线,表明存在强烈的词汇激活效应。更重要的是,结构化文本带来的额外增益似乎较少来自句子级别的逻辑排序,而更多来自短距离的标记邻接。仅保留n=2n^\star{=}2--33个标记的连续窗口就能恢复朝向完整CoT性能的大部分剩余增益。支持性实验排除了复制显式答案声明或答案值,以及完整的语法实现作为主要驱动因素。进一步的泛化实验表明,这种定性模式在多个模型家族、参数规模和数据集上保持稳定。这些结果支持探测时CoT的局部共现激活(LCA)解释,其中观察到的增益似乎主要来自词汇激活和短距离标记共现,而非句子级别的逻辑推导。

关键词

引用

@article{arxiv.2605.26795,
  title  = {What Makes Chain-of-Thought Work at Probe Time? Local Co-occurrence Rather Than Global Derivation},
  author = {Xiang Wang and Wei Wei},
  journal= {arXiv preprint arXiv:2605.26795},
  year   = {2026}
}