RIMO:一个易于评估、难以求解的奥林匹克基准,用于高级数学推理
人工智能
2025-09-10 v1
摘要
随着大型语言模型(LLM)在 GSM8K 和 MATH 等既定数学基准上取得高分,研究界已转向国际数学奥林匹克(IMO)问题,以推动评估前沿。然而,现有的奥林匹克级基准受到实际限制,这些限制引入了评分噪声和潜在偏差,例如需要基于模型的评判员的异构答案格式,以及对可能存在缺陷的解答的依赖。我们引入了 RIMO,这是一个双轨基准,旨在保持奥林匹克级难度的同时消除这种评估噪声。第一轨 RIMO-N 重写了 335 道 IMO 问题,使其具有单一、唯一的整数答案,从而允许进行确定性的正确性检查。第二轨 RIMO-P 包含 456 道带有专家检查解答的证明题,这些题目被分解为一系列子问题,以通过自动评分系统评估逐步推理过程。我们对包括 GPT-4o 和 Gemini 2.5 Flash 在内的十个前沿 LLM 进行了基准测试,结果显示,虽然这些系统在较旧的基准上表现出色,但在 RIMO 上的性能急剧下降。这些结果突显了当前 LLM 能力与实际奥林匹克级推理之间的巨大差距。通过提供一个具有挑战性且易于评估的套件,RIMO 为未来研究提供了一个高分辨率的衡量标准,为缩小我们的发现所揭示的深刻推理差距提供了一个明确的目标。
引用
@article{arxiv.2509.07711,
title = {RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning},
author = {Ziye Chen and Chengwei Qin and Yao Shu},
journal= {arXiv preprint arXiv:2509.07711},
year = {2025}
}