中文

用互信息揭示推理动态:思考标记是 LLM 推理中的信息峰值

人工智能 2025-06-05 v2 计算与语言

摘要

大推理模型(LRM)在复杂问题求解中展现了令人印象深刻的能力,但其内部推理机制仍未被充分理解。在本文中,我们从信息论角度研究 LRM 的推理轨迹。通过跟踪中间表示与正确答案之间的互信息(MI)在 LRM 推理过程中的演变,我们观察到一个有趣的 MI 峰值现象:在 LRM 的推理过程中,特定生成步骤处的 MI 会出现突然且显著的增加。我们对这一现象进行了理论分析,并表明随着 MI 的增加,模型预测错误的概率降低。此外,这些 MI 峰值通常对应于表达反思或转换的标记,例如"嗯"、"等等"和"因此",我们将其称为思考标记。然后我们证明这些思考标记对 LRM 的推理性能至关重要,而其他标记的影响微乎其微。基于这些分析,我们提出了两种简单而有效的方法,通过巧妙利用这些思考标记来提升 LRM 的推理性能。总体而言,我们的工作为 LRM 的推理机制提供了新的见解,并提供了提升其推理能力的实用方法。代码可在 https://github.com/ChnQ/MI-Peaks 获取。

关键词

引用

@article{arxiv.2506.02867,
  title  = {Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning},
  author = {Chen Qian and Dongrui Liu and Haochen Wen and Zhen Bai and Yong Liu and Jing Shao},
  journal= {arXiv preprint arXiv:2506.02867},
  year   = {2025}
}

备注

Preprint. Under review