大型多模态模型的多语言理解与推理评估基准 M4U
计算机视觉与模式识别
2025-04-28 v2 计算与语言
摘要
多语言能力是大型多模态模型的关键特性,因为它们通常部署在多个国家和语言环境中。然而,现有大多数针对多语言多模态推理的基准测试难以区分不同性能的模型;即使是没有视觉能力的语言模型也能轻松获得高分。这留下了对领先多语言多模态模型进行全面评估的工作基本未覆盖。本文引入M4U,一个新型且具有挑战性的基准,用于评估跨学科多语言多模态理解与推理能力。M4U包含1万个样本,覆盖64个学科,涵盖科学、工程和医疗保健领域的16个子域,并以6种语言呈现。通过M4U,我们对领先的大型多模态模型(LMM)和大型语言模型(LLM)进行了广泛评估。评估结果显示,最先进的模型GPT-4o在M4U上的平均准确率仅为47.6%。此外,我们观察到领先的LMM在语言偏好方面存在显著差异。我们的深入分析表明,领先的LMM,包括GPT-4o,难以处理来自视觉和文本上下文中多语言信息的推理。具体而言,它们在使用跨语言多模态问题提问时会出现性能下降。我们的代码和数据集已公开 disponible。
引用
@article{arxiv.2405.15638,
title = {M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models},
author = {Hongyu Wang and Jiayu Xu and Senwei Xie and Ruiping Wang and Jialin Li and Zhaojie Xie and Bin Zhang and Chuyan Xiong and Xilin Chen},
journal= {arXiv preprint arXiv:2405.15638},
year = {2025}
}
备注
Work in progress