中文

MEENA(波斯MMMU):面向N级评估的多模态-多语言教育考试

人工智能 2025-08-26 v1 机器学习

摘要

最近的大型视觉语言模型(VLM)进展主要聚焦于英语,其他语言的关注度有限。为弥合这一差距,我们引入MEENA(也称为PersianMMMU),这是第一个旨在评估波斯语VLMs在科学、推理和人类水平理解任务上的表现的数据集。本数据集包含约7500个波斯语和3000个英文问题,涵盖推理、数学、物理、图表和波斯艺术文学等广泛主题。MEENA的关键特征包括:(1)覆盖从小学到高中等 various 教育水平的多样化学科;(2)丰富的元数据,包括难度级别和描述性答案;(3)保留文化细微差别的原生波斯数据;(4)双语结构以评估跨语言性能;(5)一系列多样化实验评估各种能力,包括整体性能、模型对图像注意力以及生成幻觉倾向。我们希望这个基准有助于提升VLM在英语之外的能力。

关键词

引用

@article{arxiv.2508.17290,
  title  = {MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment},
  author = {Omid Ghahroodi and Arshia Hemmat and Marzia Nouri and Seyed Mohammad Hadi Hosseini and Doratossadat Dastgheib and Mohammad Vali Sanian and Alireza Sahebi and Reihaneh Zohrabi and Mohammad Hossein Rohban and Ehsaneddin Asgari and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2508.17290},
  year   = {2025}
}