中文

生成式 AI 时代下 undergraduate 数学考试评估:一个课程层面的案例研究

计算机与社会 2025-09-30 v3 人工智能

摘要

生成式人工智能(GenAI)工具如 OpenAI 的 ChatGPT 正在改变教育格局,促使人们重新考虑传统评估实践。与此同时,大学正在探索针对无监督开放书籍考试的替代方案,这引发了关于学术诚信和教育目标在无监督环境下的对齐问题。本研究探讨了在假设在无监督、开放书籍环境中使用 GenAI 工具的情况下,传统闭卷数学考试是否仍具教育相关性。采用经验方法,我们生成、转录并 blind-mark GenAI 对一所罗素集团大学八门 undergraduate 数学考试的作答,涵盖了一年级整个课程。通过将独立的 GenAI 响应组合到 individual questions 中,实现了对 GenAI 表现的有意义的评估,既在 module 层面,也在一年级课程整体上。我们发现 GenAI 的成绩相当于一等级学位的水平,尽管当前表现在不同模块之间可能有所不同。进一步地,我们发现 GenAI 的表现在整个课程范围内相当一致,这与受监督考试中学生的表现相比,一致性更高。我们的发现证明了在生成式人工智能时代,需重新设计数学中的评估,以适应无监督环境,并指出当前标准在生成式人工智能时代的教育价值可能被显著削弱。

关键词

引用

@article{arxiv.2509.13359,
  title  = {Evaluating undergraduate mathematics examinations in the era of generative AI: a curriculum-level case study},
  author = {Benjamin J. Walker and Nikoleta Kalaydzhieva and Beatriz Navarro Lameda and Ruth A. Reynolds},
  journal= {arXiv preprint arXiv:2509.13359},
  year   = {2025}
}