脆弱的数感:探究大语言模型数值推理的根本限制
机器学习
2025-09-09 v1 人工智能
摘要
大语言模型(LLM)已展现出惊人的涌现能力,但其数值推理的鲁健性仍是未知数。虽然标准基准使用聚合指标评估LLM在复杂问题集上的推理能力,但常常掩盖了基础性弱点。本文通过评估复杂度递增的问题,探索LLM的数学数感,问题包括:从组成运算到组合谜题的层级复杂性。我们测试了多个最先进的LLM-based智能体在一个100题挑战中,涵盖四个类别:(1)基本算术,(2)高级运算,(3)素数检查,(4)24数游戏谜题。我们的结果表明,尽管智能体在前三个类别——即需要确定性算法执行的类别——中取得了高准确率,但在数游戏中持续失败,凸显其对大组合空间上进行启发式搜索的显著瓶颈。这些发现揭示了智能体的专业能力主要局限于回忆和执行已知算法,而非进行生成式问题解决。这表明其表面上的数值推理更类似于精妙的模式匹配,而非灵活、分析性的思维,从而限制了其在需要新颖或创造性数值洞察的任务中的潜力。
引用
@article{arxiv.2509.06332,
title = {A Fragile Number Sense: Probing the Elemental Limits of Numerical Reasoning in LLMs},
author = {Roussel Rahman and Aashwin Ananda Mishra},
journal= {arXiv preprint arXiv:2509.06332},
year = {2025}
}