中文

VLURes:面向低资源语言的视觉-语言模型视觉与语言理解基准

计算与语言 2025-10-16 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

视觉-语言模型(VLM)是推进智能代理感知能力的关键因素。然而,VLM 的评估仍局限于以英语为主的基准测试,其中图像-文本对仅包含短文本。为评估 VLM 在细粒度能力方面,本文在四种语言、长文本场景下引入新型多语言基准 VLURes,包含八个视觉-语言任务,以及首个独立性任务,以探测 VLM 在英语、日语及低资源语言(斯瓦希利语、乌尔都语)中的细粒度视觉与语言理解能力。我们的数据集源自目标语言的网络资源,涵盖十个多样化的图像类别和丰富的文本语境,为斯瓦希利语和乌尔都语带来宝贵的视觉-语言资源。通过让 VLM 生成响应与依据,进行自动化评估及母语者评估,我们发现不同语言与任务之间的性能差异,尤其是对智能代理至关重要的任务,如对象识别、场景理解和关系理解。我们对十个 VLM 进行了 VLURes 评估。最佳-performing 模型 GPT-4o 在整体准确率达到 90.8%,与人类水平相差 6.7%,尽管对开源模型而言差距更大。该差距凸显了 VLURes 在开发面向多模态视觉推理的智能代理方面的关键作用。

关键词

引用

@article{arxiv.2510.12845,
  title  = {VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages},
  author = {Jesse Atuhurra and Iqra Ali and Tomoya Iwakura and Hidetaka Kamigaito and Tatsuya Hiraoka},
  journal= {arXiv preprint arXiv:2510.12845},
  year   = {2025}
}