中文

WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用

计算机视觉与模式识别 2026-04-15 v2 计算与语言 信息检索

摘要

多模态检索增强生成 (RAG) 已成为基于知识的视觉问答 (KB-VQA) 中一种高度有效的范式。尽管近期取得了进展,但现有方法仍然主要依赖图像作为检索键,并且常常忽视或错位视觉语言模型 (VLMs) 的作用,从而未能充分利用其潜力。在本文中,我们提出了 WikiSeeker,一个新颖的多模态 RAG 框架,通过提出多模态检索器并重新定义 VLMs 的作用来弥合这些差距。与其仅作为答案生成器,我们为 VLMs 分配了两个专门的角色:精炼器和检查器。精炼器利用 VLMs 根据输入图像重写文本查询的能力,显著提升了多模态检索器的性能。检查器通过选择性地将可靠的检索上下文路由给另一个 LLM 进行答案生成,同时在不稳定检索时依赖 VLM 的内部知识,从而实现了去耦的生成策略。在 EVQA、InfoSeek 和 M2KR 上的广泛实验表明,WikiSeeker 达到了最先进的性能,在检索准确率和回答质量方面均有显著提升。我们的代码将发布在 https://github.com/zhuyjan/WikiSeeker。

关键词

引用

@article{arxiv.2604.05818,
  title  = {WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering},
  author = {Yingjian Zhu and Xinming Wang and Kun Ding and Ying Wang and Bin Fan and Shiming Xiang},
  journal= {arXiv preprint arXiv:2604.05818},
  year   = {2026}
}

备注

Accepted by ACL 2026 Findings