MathNet:面向数学推理与检索的全球多模态基准
人工智能
2026-04-21 v1 数字图书馆
信息检索
机器学习
摘要
数学问题解决 remains 是大型语言和多模态模型推理的挑战性测试,而现有基准在规模、语言覆盖和任务多样性方面有限。我们引入 MathNet,这是一个高质量、大规模、多模态且多语言的奥林匹克级数学问题数据集,搭配用于评估生成式模型数学推理和嵌入式系统数学检索的基准。MathNet 覆盖47个国家,17种语言,涵盖两个世纪的竞赛,包含30,676个专家编写的跨领域问题及解答。除核心数据集外,我们构建了一个检索基准,包含由人类专家精选的数学等价和结构相似问题对。MathNet 支持三项任务:(i)问题解决、(ii)数学感知检索、(iii)检索增强问题解决。实验结果表明,即使是最先进的推理模型(Gemini-3.1-Pro 为78.4%,GPT-5 为69.3%)仍面临挑战,而嵌入模型在检索等价问题方面仍显不足。我们进一步表明,检索增强生成的性能对检索质量高度敏感;例如,DeepSeek-V3.2-Speciale 通过检索获得了最高可达12%的提升,在本基准上取得最高分数。MathNet 提供了目前规模最大的高质量奥林匹克数据集,以及评估数学问题检索的首个基准,我们将数据集和基准均公开发布于 https://mathnet.mit.edu。
引用
@article{arxiv.2604.18584,
title = {MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval},
author = {Shaden Alshammari and Kevin Wen and Abrar Zainal and Mark Hamilton and Navid Safaei and Sultan Albarakati and William T. Freeman and Antonio Torralba},
journal= {arXiv preprint arXiv:2604.18584},
year = {2026}
}
备注
ICLR 2026; Website: http://mathnet.mit.edu