中文

UGMathBench:面向大语言模型的 undergrad 级别数学推理多样且动态的基准

计算与语言 2025-02-26 v2 人工智能

摘要

大语言模型(LLMs)在数学推理方面取得了显著进展,凸显了对其能力进行全面且公平评估的必要性。然而,现有基准往往不足,或缺乏对 undergrad 级别数学问题的广泛覆盖,或可能受到测试集污染的影响。为此,我们引入 UGMathBench,一个为评估大语言模型在 undergrad 级别数学推理而设计的多样且动态的基准。UGMathBench 包含 5,062 个问题,覆盖 16 个学科和 111 个主题, featuring 10 种不同的答案类型。每个问题包括三个随机化版本,计划随着主要开源 LLM 在 UGMathBench 中饱和而发布额外版本。此外,我们提出了两个关键指标:有效准确率(EAcc),衡量所有三个版本中正确解决的问题的百分比;以及推理间隙(Δ\Delta),通过计算所有版本平均准确率与 EAcc 之间的差异来评估推理鲁棒性。我们对 23 项领先 LLM 的广泛评估显示,最高的 EAcc 为 56.3%,由 OpenAI-o1-mini 实现,不同模型之间观察到较大的 Δ\Delta 值。这突显了未来研究旨在开发具有高 EAcc 和 Δ=0\Delta = 0 的“大推理模型”的需要。我们预计 UGMathBench 的发布,以及其详细的评估代码,将为推动大语言模型解决数学问题的开发提供有价值的资源。代码和数据均可在 https://github.com/YangLabHKUST/UGMathBench 提供。

关键词

引用

@article{arxiv.2501.13766,
  title  = {UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models},
  author = {Xin Xu and Jiaxin Zhang and Tianhao Chen and Zitong Chao and Jishan Hu and Can Yang},
  journal= {arXiv preprint arXiv:2501.13766},
  year   = {2025}
}

备注

Accepted to ICLR 2025