EXAMS-V:用于评估视觉语言模型的多学科多语言多模态考试基准
计算与语言
2024-03-18 v1 计算机视觉与模式识别
摘要
我们引入了 EXAMS-V,一个用于评估视觉语言模型的具有挑战性的多学科多模态多语言考试基准。它包含 20,932 道多项选择题,涵盖 20 个学校学科,涉及自然科学、社会科学以及其他杂项研究(例如宗教、美术、商业等)。EXAMS-V 包含多种多模态特征,如文本、图像、表格、图形、图表、地图、科学符号和方程。这些问题以属于 7 个语系的 11 种语言呈现。与现有基准不同,EXAMS-V 的独特之处在于它通过收集来自不同国家、具有不同教育体系的学校考试问题而精心构建。这种独特的方法需要跨不同语言进行复杂推理,并依赖于特定区域的知识。解决数据集中的问题需要对文本和图像的视觉内容进行高级感知和联合推理。我们的评估结果表明这是一个具有挑战性的数据集,即使对于 GPT-4V 和 Gemini 等高级视觉文本模型也很困难;这凸显了该数据集固有的复杂性及其作为未来基准的重要性。
引用
@article{arxiv.2403.10378,
title = {EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models},
author = {Rocktim Jyoti Das and Simeon Emilov Hristov and Haonan Li and Dimitar Iliyanov Dimitrov and Ivan Koychev and Preslav Nakov},
journal= {arXiv preprint arXiv:2403.10378},
year = {2024}
}