中文

AI-算术

机器学习 2026-02-12 v1 人工智能 计算与语言

摘要

现代AI系统已成功部署于国际数学竞赛中赢得奖项,辅助研究工作流程并证明新颖的技术引理。然而,尽管在数学的高级层面取得了进展,这些模型在基本算术方面仍表现糟糕,在简单相加两个数字的任务中总是失败。我们进行系统性的调查。我们经验性地证明,所有前沿模型在数字位数增加时对整数加法的准确率显著下降。进一步,我们表明大多数错误是可解释的,可以归因于操作数错位或未能正确进位;这两种错误类别分别解释了Claude Opus 4.1、GPT-5和Gemini 2.5 Pro错误的87.9%、62.9%和92.4%。最后,我们表明错位错误常常与标记化有关,而进位错误大体上表现为独立的随机失败。

关键词

引用

@article{arxiv.2602.10416,
  title  = {AI-rithmetic},
  author = {Alex Bie and Travis Dick and Alex Kulesza and Prabhakar Raghavan and Vinod Raman and Sergei Vassilvitskii},
  journal= {arXiv preprint arXiv:2602.10416},
  year   = {2026}
}