中文

思考机器:大语言模型时代的数学推理

人工智能 2026-02-02 v2

摘要

大型语言模型(LLM)在结构化推理和符号任务方面已展现出惊人的能力,其中编码作为一个特别成功的应用。这种进步自然地激励了将这些模型扩展到数学的努力,既包括以自然语言表达的传统数学,也包括以适用于自动验证的符号语法表达的形式化数学。然而,尽管编程与证明构造之间看似的相似之处,形式化数学的进展却显著比代码生成更具挑战性。这一差距提出了关于当前 LLM 架构中推理本质、监督和反馈的作用,以及这些模型是否保持其内部计算或演绎状态概念的问题。本文综述了大语言模型进行数学推理的当前最佳实践,重点关注近期模型和基准。我们探讨了机器学习与数学认知交叉点的三个核心议题:(i)传统数学与形式化数学作为训练和评估领域之间的权衡;(ii)为什么证明合成比代码生成更脆弱的结构和方法原因;(iii)大语言模型是否真正代表或仅仅模拟一种演化逻辑状态的概念。我们的目标并非划定这些系统的刚性界限,而是阐明这些系统的当前边界,并勾勺其扩展的有前景的方向。

关键词

引用

@article{arxiv.2508.00459,
  title  = {Thinking Machines: Mathematical Reasoning in the Age of LLMs},
  author = {Andrea Asperti and Alberto Naibo and Claudio Sacerdoti Coen},
  journal= {arXiv preprint arXiv:2508.00459},
  year   = {2026}
}