AI-算术
机器学习
2026-02-12 v1 人工智能
计算与语言
摘要
现代AI系统已成功部署于国际数学竞赛中赢得奖项,辅助研究工作流程并证明新颖的技术引理。然而,尽管在数学的高级层面取得了进展,这些模型在基本算术方面仍表现糟糕,在简单相加两个数字的任务中总是失败。我们进行系统性的调查。我们经验性地证明,所有前沿模型在数字位数增加时对整数加法的准确率显著下降。进一步,我们表明大多数错误是可解释的,可以归因于操作数错位或未能正确进位;这两种错误类别分别解释了Claude Opus 4.1、GPT-5和Gemini 2.5 Pro错误的87.9%、62.9%和92.4%。最后,我们表明错位错误常常与标记化有关,而进位错误大体上表现为独立的随机失败。
引用
@article{arxiv.2602.10416,
title = {AI-rithmetic},
author = {Alex Bie and Travis Dick and Alex Kulesza and Prabhakar Raghavan and Vinod Raman and Sergei Vassilvitskii},
journal= {arXiv preprint arXiv:2602.10416},
year = {2026}
}