中文

Large Language Models Don't Make Sense of Word Problems. A Scoping review from a Mathematics Education Perspective

计算与语言 2025-08-12 v2 历史与综述

摘要

大型语言模型(LLM)如ChatGPT的进步引发了如何融入教育的疑问。一个希望是它们能支持数学学习,包括解题。由于LLM能够轻松处理文本输入,它们看起来特别适合解决数学题。然而,它们的真实能力——是否理解实际情境,以及对课堂的含义——仍不清晰。我们从数学教育视角进行了一项概览性综述,包括三个方面:技术概览、关于研究中使用的题目的系统综述,以及对LLM在数学题目上的最新实证评估。首先,在技术概览中,我们对比了LLM与学生对题目及其解题过程的概念化。在计算机科学研究中,这通常被称为数学推理,这一术语不符合数学教育中的用法。其次,我们的文献综述涵盖213项研究,显示最流行的题目库主要由s型题目组成,这些题目不要求考虑其真实情境的现实性。最后,我们对GPT-3.5-turbo、GPT-4o-mini、GPT-4.1、o3和GPT-5在287道题目上的评估显示,大多数最新LLM在解这些s型题目时几乎完美地准确率达到,其中包括在PISA题目中取得完美分数。LLM仍在处理那些情境有问题或不合理的题目时表现薄弱。总之,我们基于这三个方面认为,LLM已经掌握了一种浅显的解题过程,但并未理解题目,这可能限制了它们在数学课堂中作为教学工具的价值。

关键词

引用

@article{arxiv.2506.24006,
  title  = {Large Language Models Don't Make Sense of Word Problems. A Scoping Review from a Mathematics Education Perspective},
  author = {Anselm R. Strohmaier and Wim Van Dooren and Kathrin Seßler and Brian Greer and Lieven Verschaffel},
  journal= {arXiv preprint arXiv:2506.24006},
  year   = {2025}
}

备注

v2: added analyses for GPT-5, also leading to small adjustments in the text, no major new interpretations