面向 undergraduate 数学的自动化反馈生成:开发与评估
计算机与社会
2026-01-08 v1 人工智能
摘要
智能辅导系统长期以来能够在学生作品呈现为紧密结构化格式且问题受限的情况下提供自动即时反馈,但可靠地评估自由形式的数学推理仍然具有挑战性。我们提出了一个处理自由形式自然语言输入、处理各种边缘情况,并对提交的证明在技术正确性以及风格和呈现问题方面都能专业评论的系统。我们讨论了评估此类系统的各种方法的优缺点,展示通过我们所评估的指标,该系统生成的反馈质量在评估 early undergraduate 作业时与人类专家相当。我们对系统进行压力测试,使用一小组更高级和不寻常的问题,并报告在更具挑战性的环境中出现的显著差距和鼓舞人心的成功。该系统在模块化工作流程中使用大型语言模型。工作流程配置是 human-readable 和可编辑的,而无需编程知识,允许一些中间步骤被预计算或由 instructor 注入。我们工具的一个版本已部署在帝国理工大学数学作业平台 Lambdafeedback 上。我们也报告了该工具在该平台上的集成情况。
引用
@article{arxiv.2601.03458,
title = {Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant},
author = {Aron Gohr and Marie-Amelie Lawn and Kevin Gao and Inigo Serjeant and Stephen Heslip},
journal= {arXiv preprint arXiv:2601.03458},
year = {2026}
}