中文

MathOdyssey:使用 Odyssey 数学数据基准测试大语言模型的数学问题解决能力

计算与语言 2024-06-27 v1 人工智能

摘要

大语言模型(LLMs)已显著推动了自然语言理解,并展示出强大的问题解决能力。尽管如此,大多数 LLMs 仍在解决需要复杂推理的数学问题方面存在挑战。本文使用全新的“MathOdyssey”数据集调查了 LLMs 的数学问题解决能力。该数据集包含来自知名机构专家创建的多样化高中和大学水平数学问题,以严格测试 LLMs 在高级问题解决情景中的能力,并涵盖更广泛的学科领域。通过为 AI 社区提供 MathOdyssey 数据集作为资源,我们旨在促进对 LLMs 在复杂数学问题解决能力的理解与改进。我们对开源模型(如 Llama-3 和 DBRX-Instruct)以及来自 GPT 系列和 Gemini 模型的闭源模型进行了基准测试。我们的结果表明,尽管 LLMs 在常规和中等难度任务上表现良好,但在奥林匹克级问题和复杂大学水平问题上面临重大挑战。我们的分析显示,开源模型与闭源模型之间的性能差距正在缩小,但仍存在诸多挑战,尤其是针对最具挑战性的问题。本研究突显了持续需要为 LLMs 提升数学推理能力的研究。该数据集、结果和代码均已公开 avail。

关键词

引用

@article{arxiv.2406.18321,
  title  = {MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data},
  author = {Meng Fang and Xiangpeng Wan and Fei Lu and Fei Xing and Kai Zou},
  journal= {arXiv preprint arXiv:2406.18321},
  year   = {2024}
}