VLM@school -- 德国中学知识上的 AI 图像理解评估
人工智能
2025-06-30 v2 计算与语言
计算机视觉与模式识别
摘要
本文介绍了一个新颖的基准数据集,用于评估视觉语言模型(VLM)在结合视觉推理与特定领域背景知识的任务上的能力。与常用英文基准那些常依赖人工制造难度或脱离语境的问题不同,本数据集源自德国中学课程中覆盖数学、历史、生物、宗教等九个领域的真实教材。该基准包含超过 2000 个以 486 张图片为依据的开放式问题,确保模型必须整合视觉解释与事实推理,而不能依赖表面的文本线索。我们对 13 个最先进的开源权重 VLM 在多个维度上进行评估,包括领域特定准确率和对对抗性问题的表现。我们的发现表明,即便是最强的模型在整体准确率上也不到 45%,在音乐、数学和对抗性情境中表现尤其差。此外,结果表明热门基准上的成功与真实多模态理解之间存在显著差异。我们得出结论,中学水平的任务是检验 VLM 能力的有意义且未被充分利用的途径,尤其在非英语语境下。该数据集和评估协议为更好地理解和改进未来 AI 系统的视觉与语言推理能力提供了严格的测试平台。
引用
@article{arxiv.2506.11604,
title = {VLM@school -- Evaluation of AI image understanding on German middle school knowledge},
author = {René Peinl and Vincent Tischler},
journal= {arXiv preprint arXiv:2506.11604},
year = {2025}
}
备注
Peinl, Ren\'e; Tischler, Vincent (2025): VLM@school - Evaluation of AI image understanding on German middle school knowledge. Future Technologies Conference (FTC) 2025, Munich, Germany 2025 (accepted)