中文

大语言模型是否真正掌握数学?来自认知心理学的实证探索

人工智能 2025-09-23 v6 计算与语言 机器学习

摘要

大语言模型 (LLM) 解决数学问题的认知机制是广为讨论且尚未解决的议题。目前缺乏将 LLM 问题解决与人类认知心理学相联系的可解释实证证据。为确定 LLM 是否具备类人数学推理能力,我们修改了用于人类认知反射测试 (CRT) 的问题。我们的结果表明,即使采用链式思维 (CoT) 提示,主流 LLM 包括最新表明推理能力的 o1 模型,在解决这些修改后的 CRT 问题时仍存在较高错误率。具体而言,平均准确率相较于原题下降了最高可达 50%。进一步分析 LLM 的错误答案表明,它们主要依赖训练数据中的模式匹配,这更符合人类直觉 (系统 1 思维) 而非人类类推理 (系统 2 思维)。这一发现挑战了 LLM 具备与人类相当的真正数学推理能力的信念。因此,本工作可能调适对 LLM 在人工通用智能进程方面持过于乐观的看法。

关键词

引用

@article{arxiv.2410.14979,
  title  = {Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology},
  author = {Wei Xie and Shuoyoucheng Ma and Zhenhua Wang and Enze Wang and Kai Chen and Xiaobing Sun and Baosheng Wang},
  journal= {arXiv preprint arXiv:2410.14979},
  year   = {2025}
}

备注

Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/24x9t7s1