中文

纵观全局:评估多模态 LLM 解释和评分手写学生作业的能力

计算机视觉与模式识别 2025-10-08 v1 人工智能

摘要

多模态大语言模型(MLLM)的最新进展引发了关于它们在评改、分析手写学生课堂作业并提供反馈方面的潜力的疑问。这种能力在初等和中等数学教育中将尤为有益,因为大多数作业仍然是手写的,查看学生对问题的完整解题过程为了解其学习过程提供了宝贵见解,但评改极其耗时。我们提出了两个实验,调查 MLLM 在手写学生数学课堂作业上的表现。实验 A 考察了来自加纳中学生解答具有客观答案的算术题的 288 份手写答卷。在此背景下,模型达到了接近人类的准确率(95%,k = 0.90),但表现出人类教育者不太可能犯的偶然性错误。实验 B 评估了来自美国小学生的 150 幅数学插图,其中图画是问题的答案。这些任务缺乏单一的客观答案,需要复杂的视觉解释以及教学判断才能对其进行分析和评估。我们试图将 MLLM 的视觉能力与其教学能力区分开来,首先要求它们直接对学生插图进行评分,然后用插图的详细人类描述来增强图像。我们发现,当模型必须直接分析学生插图时,它们很吃力,与真实分数仅达到 k = 0.20 的一致性,但当给定人类描述时,它们的一致性水平显著提高到 k = 0.47,这与人与人之间的一致性水平相当。这一差距表明,MLLM 能够相对较好地“看到”并解释算术作业,但在“看到”学生数学插图方面仍有困难。

关键词

引用

@article{arxiv.2510.05538,
  title  = {Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work},
  author = {Owen Henkel and Bill Roberts and Doug Jaffe and Laurence Holt},
  journal= {arXiv preprint arXiv:2510.05538},
  year   = {2025}
}