M5 — 多语言多文化视觉语言任务基准
计算与语言
2024-08-27 v2
摘要
自 ChatGPT 发布以来,自然语言处理领域经历了快速发展,尤其是大型语言模型(LLM)及其多模态对手——大型多模态模型(LMM)。尽管这些模型功能强大,但 LLM 在不同语言和文化语境下的表现常常存在显著差异,这已被各种文本基准所证明。然而,当前研究在多模态视觉语言场景中缺乏此类基准测试。本工作通过引入 M5,弥补了这一空白。M5 是首个综合性基准,旨在评估 LMM 在多语言多文化语境下的多样化视觉语言任务性能。M5 包含 8 个数据集,覆盖 5 项任务,涵盖 41 种语言,重点关注欠代表语言和文化多样化图像。此外,我们还引入两个新数据集:M5-VGR 和 M5-VLOD,其中包含一种新的视觉语言离群点检测任务(Visio-Linguistic Outlier Detection),在该任务中,所有评估的开源模型均未显著超越随机基线。通过广泛的评估与分析,我们揭示了在高资源语言和低资源语言之间存在显著的任务无关性性能差异。更进一步,我们表明在多语言环境下,较大的模型并不一定优于较小的模型。
引用
@article{arxiv.2407.03791,
title = {M5 -- A Diverse Benchmark to Assess the Performance of Large Multimodal Models Across Multilingual and Multicultural Vision-Language Tasks},
author = {Florian Schneider and Sunayana Sitaram},
journal= {arXiv preprint arXiv:2407.03791},
year = {2024}
}