SketchJudge:面向手绘图图的多模态大语言模型诊断性基准
计算机视觉与模式识别
2026-01-13 v1 人工智能
摘要
尽管多模态大语言模型(MLLM)在视觉理解方面取得了显著进展,但它们在面对人类生成草图的非结构化和模糊性时仍常感到困难。这一限制在视觉评分任务中尤为突出——在该任务中,模型不仅要解题,还要诊断手绘图中的错误。这种诊断能力依赖于复杂的结构、语义和元认知推理。为弥合这一差距,我们引入SketchJudge,一个针对评估MLLM作为手绘STEM图评分员的新型基准。SketchJudge包含1,015幅手绘学生作答,涵盖几何、物理、图表和流程图四个领域,具有多样化的风格变体和不同的错误类型。对SketchJudge的评估表明,即便是先进的MLLM也显著落后于人类,这验证了该基准在揭示当前视觉语言对齐在符号和噪声环境下脆弱性方面的有效性。所有数据、代码和评估脚本均公开于https://github.com/yuhangsu82/SketchJudge。
引用
@article{arxiv.2601.06944,
title = {SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models},
author = {Yuhang Su and Mei Wang and Yaoyao Zhong and Guozhang Li and Shixing Li and Yihan Feng and Hua Huang},
journal= {arXiv preprint arXiv:2601.06944},
year = {2026}
}
备注
8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices