中文

RAVENEA:面向多模态检索增强视觉文化理解的基准

计算机视觉与模式识别 2026-02-17 v2 计算与语言

摘要

随着视觉语言模型日益融入日常生活,对准确的视觉文化理解的需求正变得至关重要。然而,这些模型在有效解读文化细微差异方面常常存在不足。先前的工作已经证明了检索增强生成在纯文本设置中增强文化理解的有效性,但其在多模态场景中的应用仍有待探索。为了弥补这一空白,我们引入了 RAVENEA(Retrieval-Augmented Visual culturE uNdErstAnding),这是一个旨在通过检索推进视觉文化理解的新基准,专注于两项任务:聚焦文化的视觉问答和基于文化的图像描述。RAVENEA 通过整合由人工标注者筛选和排序的 11,396 余篇独特 Wikipedia 文档,对现有数据集进行了扩展。通过对七个多模态检索器和十五个 VLM 的广泛评估,RAVENEA 揭示了一些此前未发现的结论: 总体而言,文化基础标注可以增强多模态检索及相应的下游任务。 当 VLM 结合文化感知检索进行增强时,通常优于其未增强的对应模型(在 cVQA 上平均提升 +6%,在 cIC 上提升 +11%)。 文化感知检索增强的性能在不同国家间差异很大。这些发现凸显了当前多模态检索器和 VLM 的局限性,强调了在 RAG 系统中增强视觉文化理解的必要性。我们相信 RAVENEA 为推进检索增强视觉文化理解的研究提供了宝贵的资源。

关键词

引用

@article{arxiv.2505.14462,
  title  = {RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding},
  author = {Jiaang Li and Yifei Yuan and Wenyan Li and Mohammad Aliannejadi and Daniel Hershcovich and Anders Søgaard and Ivan Vulić and Wenxuan Zhang and Paul Pu Liang and Yang Deng and Serge Belongie},
  journal= {arXiv preprint arXiv:2505.14462},
  year   = {2026}
}

备注

ICLR 2026; Project page: https://jiaangli.github.io/ravenea/