HARDMath2:由研究生课程中的学生构建的应用数学基准
机器学习
2025-05-20 v1 人工智能
摘要
大型语言模型(LLM)在数学问题解决方面取得了显著进展,但评估主要集中在具有精确解析解或涉及形式证明的问题上,常常忽视了应用科学和工程中常见的近似问题。为填补这一空白,我们在既有工作基础上提出HARDMath2,包含211个覆盖介绍性研究生应用数学课程核心主题的原创问题,包括边界层分析、WKB方法、非线性偏微分方程的渐近解以及振荡积分的渐近行为。该数据集由哈佛大学一门核心研究生应用数学课程的学生和教师设计并验证。我们通过一种新颖的合作环境构建数据集,该环境挑战学生编写和细化符合课程大纲的困难问题,进行同伴验证解答,测试不同模型,并自动检查LLM生成的解答是否与学生答案和数值真实答案相符。评估结果表明,领先的前沿模型在数据集中的许多问题上仍表现不佳,凸显了当前LLM数学推理能力的不足。重要的是,学生通过与模型交互并利用常见失败模式,识别了创建越来越困难问题的策略。这次与模型的来回交互不仅导致了更丰富、更具挑战性的基准,还促进了学生对课程材料的理解深化,这在进入大语言模型能够跨越广泛领域解决众多具有挑战性问题的时代尤为重要。
引用
@article{arxiv.2505.11774,
title = {HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class},
author = {James V. Roggeveen and Erik Y. Wang and Will Flintoft and Peter Donets and Lucy S. Nathwani and Nickholas Gutierrez and David Ettel and Anton Marius Graf and Siddharth Dandavate and Arjun Nageswaran and Raglan Ward and Ava Williamson and Anne Mykland and Kacper K. Migacz and Yijun Wang and Egemen Bostan and Duy Thuc Nguyen and Zhe He and Marc L. Descoteaux and Felix Yeung and Shida Liu and Jorge García Ponce and Luke Zhu and Yuyang Chen and Ekaterina S. Ivshina and Miguel Fernandez and Minjae Kim and Kennan Gumbs and Matthew Scott Tan and Russell Yang and Mai Hoang and David Brown and Isabella A. Silveira and Lavon Sykes and Ahmed Roman and William Fredenberg and Yiming Chen and Lucas Martin and Yixing Tang and Kelly Werker Smith and Hongyu Liao and Logan G. Wilson and Alexander Dazhen Cai and Andrea Elizabeth Biju and Michael P. Brenner},
journal= {arXiv preprint arXiv:2505.11774},
year = {2025}
}