中文

评估大语言模型在缺乏代表性数学竞赛问题上的推理能力

人工智能 2026-01-01 v1

摘要

理解大型语言模型(LLM)在数学推理中的局限性是近期几项研究的焦点。然而,这些研究大多使用相同的数据集进行基准测试,这限制了发现的可推广性,也可能未能完全捕捉数学任务中所呈现的多样性挑战。本研究的目的是分析 LLM 在缺乏代表性数学竞赛问题上的表现。我们使用 GPT-4o-mini、Gemini-2.0-Flash 和 DeepSeek-V3 三个领先的 LLM,对美国密苏里大学数学竞赛中的问题进行了提示测试,涵盖微积分、解析几何和离散数学三个领域。随后将 LLM 的响应与已知正确解答进行比较,以确定每个问题领域中 LLM 的准确性。我们还分析了 LLM 的推理,以探索不同问题类型和模型之间的错误模式。DeepSeek-V3 在三个类别的微积分、解析几何和离散数学中表现最佳,既在推理方面也在正确最终答案方面均表现出色。所有三个 LLM 在几何学方面的表现都表现出显著的弱势。DeepSeek-V3 大多数错误归因于计算和逻辑错误,而 GPT-4o-mini 经常出现逻辑和方法相关的错误。相比之下,Gemini 倾向于在推理不完整和草率得出结论方面感到困难。总之,在缺乏代表性的数学竞赛数据集上评估 LLM 可以提供对其不同错误模式的更深入见解,并凸显在几何学等结构化推理领域仍存的挑战。

关键词

引用

@article{arxiv.2512.24505,
  title  = {Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems},
  author = {Samuel Golladay and Majid Bani-Yaghoub},
  journal= {arXiv preprint arXiv:2512.24505},
  year   = {2026}
}

备注

7 pages, submitted to ACM Transactions on Intelligent Systems and Technology