面向稳健数学推理
计算与语言
2025-11-04 v1 人工智能
摘要
为推进基础模型的数学推理能力,寻找合适的北极星指标至关重要,尤其是因为现有评估要么过于容易,要么仅关注获取正确简短答案。为此,我们提出IMO-Bench,一套面向国际数学奥林匹克(IMO)水平的高级推理基准,由顶尖专家小组审核,旨在针对年轻数学家最著名的 venue 进行测试。IMO-AnswerBench 首先测试模型在400个多样化奥林匹克问题上的表现,答案可验证。IMO-Proof Bench 是 proof-writing 能力的下一级评估,包括基本和高级IMO水平问题,并附有详细的评分指南以促进自动评分。这些基准在我们在2025年IMO中取得金牌成就中起到了关键作用(Luong 和 Lockhart, 2025)。我们的模型在IMO-AnswerBench 上取得80.0%的分数,在高级IMO-Proof Bench 上取得65.7%的分数,显著超过最佳非Gemini模型,分别超过了6.9%和42.4%。我们还展示了与Gemini推理相关的自动评分器与人类评估之间良好的相关性,并构建IMO-GradingBench,包含1000个人类评分,以促进对长形式答案的自动评估。我们希望IMO-Bench能帮助社区推进稳健的数学推理,并在https://imobench.github.io/上发布。
引用
@article{arxiv.2511.01846,
title = {Towards Robust Mathematical Reasoning},
author = {Thang Luong and Dawsen Hwang and Hoang H. Nguyen and Golnaz Ghiasi and Yuri Chervonyi and Insuk Seo and Junsu Kim and Garrett Bingham and Jonathan Lee and Swaroop Mishra and Alex Zhai and Clara Huiyi Hu and Henryk Michalewski and Jimin Kim and Jeonghyun Ahn and Junhwi Bae and Xingyou Song and Trieu H. Trinh and Quoc V. Le and Junehyuk Jung},
journal= {arXiv preprint arXiv:2511.01846},
year = {2025}
}
备注
EMNLP 2025 (main conference), https://aclanthology.org/2025.emnlp-main.1794/