MVL-SIB: 大规模多语言视觉语言基准用于跨模态主题匹配
计算与语言
2025-02-19 v1
摘要
现有的多语言视觉语言(VL)基准通常仅覆盖少数语言。因此,对大型视觉语言模型(LVLMs)的评估主要针对高资源语言,凸显了对低资源语言评估数据的需求。为此,我们引入MVL-SIB,一个覆盖205种语言的大规模多语言视觉语言基准,用于评估跨模态和文本唯一的主题匹配。随后我们对一系列开源权重LVLMs以及GPT-4o(-mini)在MVL-SIB上的进行基准测试。我们的结果表明,LVLMs在低资源语言的跨模态主题匹配方面困难,在诸如N'Koo等语言上表现不佳于随机。我们的分析进一步揭示了,LVLMs在低资源语言上的VL支持相对于文本支持下降,这一点通过跨模态和文本唯一的主题匹配性能比较得出。我们进一步观察到,开源权重LVLMs在表示多个图像时并不受益于表示一个主题,这表明这些模型尚未完全有效地处理多图像任务。通过将MVL-SIB上的表现与其他多语言VL基准相关联,我们表明MVL-SIB是评估LVLMs中多语言VL理解的全面探针。
引用
@article{arxiv.2502.12852,
title = {MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matching},
author = {Fabian David Schmidt and Florian Schneider and Chris Biemann and Goran Glavaš},
journal= {arXiv preprint arXiv:2502.12852},
year = {2025}
}