中文

CombiGraph-Vis:面向离散数学推理的精选多模态奥林匹克基准

人工智能 2025-11-03 v1

摘要

随着最先进的大语言模型(SOTA LLM)从在基于证明的奥林匹克问题上摇摆,逐渐能够解答大多数IMO 2025问题,领先系统据称能处理5个6个问题中的5个。鉴于这一进展,我们评估了这些模型在对证明进行评分方面的能力:检测错误、判断其严重程度以及在二元正确性之外的公平评分。我们使用由90个Gemini 2.5 Pro生成的解答构成的语料库进行证明分析,按1-4分进行详细错误标注,并对MathArena中IMO/USAMO 2025的解答进行评分(0-7分)。我们的分析表明,模型能够可靠地标记错误(包括微妙的错误)解答,但在部分信用分配方面存在校准差距。为此,我们引入基于智能体的工作流程,从提取和分析参考解答中自动派生问题特定的评分标准,以实现多步骤评分过程。我们实例化并比较了评分工作流程的不同设计选择,并评估了它们的权衡。在我们的标注语料库和MathArena上,我们提出的工作流程实现了更高的与人类评分一致性,并在多项指标上更一致地处理部分信用。我们发布了所有代码、数据和提示/日志,以促进未来研究。

关键词

引用

@article{arxiv.2510.27094,
  title  = {CombiGraph-Vis: A Curated Multimodal Olympiad Benchmark for Discrete Mathematical Reasoning},
  author = {Hamed Mahdavi and Pouria Mahdavinia and Alireza Farhadi and Pegah Mohammadipour and Samira Malek and Majid Daliri and Pedram Mohammadipour and Alireza Hashemi and Amir Khasahmadi and Vasant Honavar},
  journal= {arXiv preprint arXiv:2510.27094},
  year   = {2025}
}

备注

Code/data: https://github.com/ref-grader/ref-grader, https://huggingface.co/datasets/combviz/inoi