中文

链路探针:检验 CoT 步骤的必要性与准确性

计算与语言 2025-03-18 v2

摘要

当前研究发现大型语言模型(LLM)中的早期答复问题,即模型在生成链式思维(CoT)之前就已具有答案。这一现象暗示了预测答案与推理过程之间可能不存在必要的依赖关系。因此,提出两个重要问题:(1)如果模型已经拥有答案,CoT 是否仍然必要?(2)答案的正确性是否可以作为 CoT 正确性的有效证据?为回答这些问题,我们提出了一种方法,即链路探针(Chain-of-Probe, CoP),用于探测模型推理期间心态的变化。探针结果显示,在大量问答案例中,CoT 似乎并非必需,且这种必要性与任务的简单性相关联,即由所需的推理步骤定义。此外,通过分析心态变化的模式,我们检查了模型推理的正确性。我们的验证结果表明,尽管许多响应在最终答案上是正确的,但其推理过程中包含错误。为此,我们提出了一种基于 CoP 的策略,优先考虑多个候选答案中推理正确的答案,从而增强模型推理的可靠性。

关键词

引用

@article{arxiv.2406.16144,
  title  = {Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step},
  author = {Zezhong Wang and Xingshan Zeng and Weiwen Liu and Yufei Wang and Liangyou Li and Yasheng Wang and Lifeng Shang and Xin Jiang and Qun Liu and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2406.16144},
  year   = {2025}
}

备注

Accepted by Findings of NAACL 2025