中文

LLM 推理链中准确性的词汇线索

计算与语言 2025-08-25 v1 机器学习

摘要

通过强化学习对大型语言模型 (LLM) 进行微调,以生成显式的链式思维 (Chain-of-Thought, CoT) 然后再回答问题,可以提高模型在代码、数学和常识基准测试中的整体表现。然而,在目前 LLM 在人类最后考试 (Humanity's Last Exam, HLE) 等基准测试中准确率较低的场景中,它们常常报告高置信度,这反映出模型校准效果较差。本文我们测试是否可以从 CoT 的可测量属性中获得可靠的 LLM 对答案内部置信度的信号。我们分析了三个特征类别:(i) CoT 长度;(ii) CoT 内部情感波动性;(iii) 词汇线索,包括缓和词汇。我们使用 DeepSeek-R1 和 Claude 3.7 Sonnet 在人类最后考试 (HLE) 和 Omni-MATH 上进行测试。我们发现,CoT 中不确定性词汇标记(如 guess、stuck、hard)是判断错误回答的最强指示器,而 CoT 情感变化提供的信号较弱但可互补。只有在 Omni-MATH 上,CoT 长度才具有信息价值(准确率约 70%),而在更难的 HLE(准确率约 9%)上毫无信号,这表明 CoT 长度仅在模型已证明能力范围内的中等难度基准测试中预测正确性,而在更高难度测试中则毫无参考价值。最后,我们发现 CoT 中的不确定性指示符始终比高置信度指示符更显著,这使得错误更容易被预测而正确回答则相对困难。我们的发现支持一种轻量级事后校准信号,可补充不可靠的自报告概率,支持更安全的 LLM 部署。

关键词

引用

@article{arxiv.2508.15842,
  title  = {Lexical Hints of Accuracy in LLM Reasoning Chains},
  author = {Arne Vanhoyweghen and Brecht Verbeken and Andres Algaba and Vincent Ginis},
  journal= {arXiv preprint arXiv:2508.15842},
  year   = {2025}
}

备注

21 pages, 7 figures, 6 tables