打破多模态知识型视觉问答中的视觉捷径
计算机视觉与模式识别
2026-02-27 v2
摘要
现有的多模态知识型视觉问答 (MKB-VQA) 基准存在“视觉捷径”问题,即查询图像通常与目标文档的主要主题实体相匹配。我们展示了模型可利用这些捷径而仅凭视觉线索即可获得相当的结果。为此,我们引入 Relational Entity Text-Image kNowledge Augmented (RETINA) 基准,由 LLM 驱动的管道自动构建,包含 12 万训练样本和 2 千人工标注测试样本。RETINA 中的查询引用次要主题(即相关实体),并与这些相关实体的图像配对,从而消除视觉捷径。评估 RETINA 时,现有模型表现显著下降,确认了其对捷径的依赖。此外,我们提出 Multi-Image MultImodal Retriever (MIMIR),通过增强多个相关实体的图像来丰富文档嵌入,有效处理 RETINA,而先前方法仅为每个文档使用单个图像。我们的实验验证了现有基准的局限性,并展示了 RETINA 和 MIMIR 的有效性。我们的项目地址为:Project Page。
引用
@article{arxiv.2511.22843,
title = {Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering},
author = {Dosung Lee and Sangwon Jung and Boyoung Kim and Minyoung Kim and Sungyeon Kim and Junyoung Sung and Paul Hongsuck Seo},
journal= {arXiv preprint arXiv:2511.22843},
year = {2026}
}