中文

AMO-Bench:大语言模型在高中数学竞赛中的困境

计算与语言 2025-10-31 v1 人工智能

摘要

我们提出 AMO-Bench,即一个具备国际数学奥林匹克水平或更高难度的高级数学推理基准,包含 50 个人工精心设计的题目。现有基准广泛利用高中数学竞赛评估大语言模型 (LLM) 的数学推理能力,但许多竞赛因性能饱和 (如 AIME24/25) 而不再有效评估顶尖 LLM。为此,AMO-Bench 通过确保所有 50 题 (1) 经专家交叉验证,达到国际数学奥林匹克难度标准;(2) 完全原创问题,以防止数据记忆导致的性能泄漏。此外,AMO-Bench 的每道题仅要求最终答案,而非证明,从而实现自动化稳健的评分。实验结果显示,26 个 LLM 在 AMO-Bench 上表现不佳,即使表现最好的模型也仅 achieving 52.4% 的准确率,大多数模型得分低于 40%。进一步分析揭示了随测试时计算增加而表现呈正相关趋势的前景。这表明当前 LLM 在数学推理方面仍有显著提升空间。我们发布 AMO-Bench 以推动语言模型推理能力的进一步研究。https://amo-bench.github.io/

关键词

引用

@article{arxiv.2510.26768,
  title  = {AMO-Bench: Large Language Models Still Struggle in High School Math Competitions},
  author = {Shengnan An and Xunliang Cai and Xuezhi Cao and Xiaoyu Li and Yehao Lin and Junlin Liu and Xinxuan Lv and Dan Ma and Xuanlin Wang and Ziwen Wang and Shuang Zhou},
  journal= {arXiv preprint arXiv:2510.26768},
  year   = {2025}
}

备注

14 pages, 9 figures