中文

HARP: A challenging human-annotated math reasoning benchmark

机器学习 2024-12-13 v1

摘要

数学推理正成为关注的焦点不断增加的领域,我们正在扩大大语言模型的规模。然而,即使是之前最强的评估如MATH现在也接近饱和(o1-mini为90.0%,Gemini 1.5 Pro为86.5%)。我们引入HARP,Human Annotated Reasoning Problems(For Math),包含来自美国国家数学竞赛(A(J)HSME、AMC、AIME、USA(J)MO)的5,409个问题,其中4,780个问题具有可自动检查的答案(使用SymPy等库)。这些问题涵盖六个难度级别,在最难的197个问题上,前沿模型表现相对较差(o1-mini平均准确率为41.1%,Gemini 1.5 Pro为9.6%)。我们的数据集还包含多个选择(针对4,110个问题)以及每个问题平均两个人类编写的参考解,为新的研究方法提供了新的研究机会。我们报告了许多前沿模型的评估结果,并分享了一些有趣的分析,如表明前沿模型在不同家族中会本质上扩展其推理时间计算以应对更难的问题。最后,我们开源了用于数据集构建(包括爬虫)的所有代码以及用于评估(包括答案检查)的所有代码,以便在https://github.com/aadityasingh/HARP上进行未来研究。

关键词

引用

@article{arxiv.2412.08819,
  title  = {HARP: A challenging human-annotated math reasoning benchmark},
  author = {Albert S. Yue and Lovish Madaan and Ted Moskovitz and DJ Strouse and Aaditya K. Singh},
  journal= {arXiv preprint arXiv:2412.08819},
  year   = {2024}
}

备注

28 pages, 17 figures