基于自然语言处理的数学归纳证明自动批改
人工智能
2025-07-15 v2 计算与语言
人机交互
摘要
在数学证明教育中,仍需寻找能够帮助学生学习编写数学证明的干预措施。研究表明,及时的反馈对学习新技能的学生非常有帮助。虽然多年来,自然语言处理模型在与数学文本相关的任务上一直表现不佳,但近期发展为完成给学生即时反馈提供了机会。本文提出了一套训练方法和模型,能够通过利用现有的大型语言模型和其他机器学习技术,对自由形式的数学证明进行自动批改。这些模型使用来自四个不同归纳证明问题收集的证据数据进行训练。我们使用四个不同的健壮大型语言模型进行比较,所有模型都以不同程度达到了令人满意的性能。此外,我们邀请人类评分者对同一证明进行评分,发现最佳批改模型也比大多数人类评分者更准确。随着这些批改模型的发展,我们创建并部署了一个用于归纳证明问题的自动批改系统,并进行了用户研究。研究结果表明,学生能够通过利用自动批改系统提供的反馈,对自己的证明进行显著改进,但学生仍不太信任 AI 自动批改系统,信任度仍低于人类评分者。未来的工作可以改进自动批改系统的反馈,并寻找帮助学生信任 AI 批改系统的方法。
引用
@article{arxiv.2406.10268,
title = {Autograding Mathematical Induction Proofs with Natural Language Processing},
author = {Chenyan Zhao and Mariana Silva and Seth Poulsen},
journal= {arXiv preprint arXiv:2406.10268},
year = {2025}
}