中文

MAVIS:面向长篇视觉问答的多模态来源归因基准

计算机视觉与模式识别 2025-12-19 v2

摘要

来源归因旨在通过为每个声明提供参考信息来增强AI生成答案的可靠性,帮助用户验证所提供的答案。然而,现有工作主要关注文本场景,很大程度上忽略了多模态的作用。我们介绍MAVIS,这是第一个设计用于评估多模态来源归因系统的基准,旨让系统理解视觉问题背后的用户意图、检索多模态证据并生成带引用的长篇答案。数据集包含15.7万个视觉问答实例,其中每个答案都标注了指向多模态文档的事实级别引用。我们开发了沿三个维度(信息性、可 grounding 性和流畅性)的细粒度自动指标,并证明其与人类判断高度相关。我们的主要发现有三点:(1)具有多模态RAG的大语言模型比单模态RAG生成更具信息性和流畅性,但在图像文档上表现出较弱的可 grounding 性,这一差距在多模态情境下被放大。(2)在相同的多模态文档下,不同提示方法之间在信息性和可 grounding 性之间存在权衡。(3)我们提出的方法突显了在解释图像文档时减轻情境偏差是一个关键的未来研究方向。

关键词

引用

@article{arxiv.2511.12142,
  title  = {MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering},
  author = {Seokwon Song and Minsu Park and Gunhee Kim},
  journal= {arXiv preprint arXiv:2511.12142},
  year   = {2025}
}

备注

AAAI 2026; code is available at https://github.com/seokwon99/MAVIS