中文

人工智能grading助手用于微积分考试手写题部分

计算机与社会 2025-11-14 v2 人工智能

摘要

我们探讨了当代多模态大语言模型在不牺牲有效性的前提下,是否能够在规模化情况下协助对开放性微积分题目进行评分。在一份大型一年级考试中,学生的手写作品被GPT-5依据教学助手使用的同一评分标准进行评分,允许赋予部分分数;教学助手的评分决定作为基准真实值。我们校准了一个人类在环过滤器,将部分信用阈值与基于学生-题目单元得分偏差的项目反应理论(2PL)风险度量相结合。未经过滤的AI与TA的一致性仅属中等程度,足以用于低风险反馈,但不足以用于高风险场景。置信过滤使工作量与质量之间的权衡变得明确:在更严格的设置下,AI能够实现人类水平的准确性,但也会留下约70%的题目需由人类评分。心理测量模式受到手写部分低风险、评分检查点数量有限以及指定答案区域与作品出现位置偶发性不匹配的制约。实践性的调整,如略微提高权重和受保护时间、若干可见的评分步骤、更强的空间锚定应能提升最高性能水平。总体而言,校准后的置信度和保守的路由策略使AI能够可靠地处理一大部分常规案例,同时保留专家判断用于含义模糊或具有教育价值的响应。

关键词

引用

@article{arxiv.2510.05162,
  title  = {Artificial-Intelligence Grading Assistance for Handwritten Components of a Calculus Exam},
  author = {Gerd Kortemeyer and Alexander Caspar and Daria Horica},
  journal= {arXiv preprint arXiv:2510.05162},
  year   = {2025}
}