当 VLMs "修复"学生:识别和惩罚多行手写数学 OCR 中的过度纠错
计算机与社会
2026-05-27 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
手写数学的准确转录对于教育 AI 系统至关重要,但当前基准未能正确评估这一能力。大多数先前研究聚焦于单行表达式,依赖诸如 BLEU 等词汇指标,无法评估跨多行学生解答的语义推理。在本文中,我们首次系统性地研究了多行手写数学光学字符识别(OCR),揭示了视觉-语言模型(VLM)的关键失效模式:过度纠错。相对于忠实地转录学生的作品,这些模型常常会 "修复" 错误,从而隐藏了教育评估旨在检测的错误。为此,我们提出了 PINK(惩罚性墨水得分),这是一种语义评估指标,利用大型语言模型(LLM)进行基于评分标准的评分,并显式惩罚过度纠错。我们对 15 个最先进的 VLM 在 FERMAT 数据集上的全面评估揭示了与 BLEU 显著的排名反转:如 GPT-4o 因积极过度纠错而受到严厉惩罚,而 Gemini 2.5 Flash 则表现为最忠实的转录者。此外,人类专家研究显示,PINK 在人类判断方面的偏好比 BLEU 的 55.0% 高于 39.5%,为教育环境下手写数学 OCR 提供了更可靠的评估框架。
引用
@article{arxiv.2604.22774,
title = {When VLMs 'Fix' Students: Identifying and Penalizing Over-Correction in the Evaluation of Multi-line Handwritten Math OCR},
author = {Jin Seong and Wencke Liermann and Minho Kim and Jong-hun Shin and Soojong Lim},
journal= {arXiv preprint arXiv:2604.22774},
year = {2026}
}