中文

面向知识驱动的视觉问答的掩码-选择框架

计算机视觉与模式识别 2026-02-19 v1 人工智能

摘要

知识驱动的视觉问答(KB-VQA)要求模型通过整合视觉信息和外部知识来回答问题。然而,检索到的知识常常噪声较大、部分不相关或与视觉内容错位,而模型内部知识难以控制和解释。对这些来源的简单聚合会限制推理效果并降低答案准确率。为此,我们提出MaS-VQA,一种以选择为导向的框架,将显式知识过滤与隐式知识推理紧密耦合。MaS-VQA首先检索候选段落,并应用掩码-选择机制,联合修剪无关的图像区域和弱相关的知识片段,产生紧凑且高信噪比的多模态知识。经过滤除的知识指引模型在受限语义空间内激活内部知识,实现显式与隐式知识的互补建模,从而实现稳健的答案预测。在Encyclopedic-VQA和InfoSeek上进行的实验表明,跨越多个大型语言模型后端,方法均实现了一致的性能提升,消融实验也验证了选择机制有效降低了噪声并提升了知识利用效率。

关键词

引用

@article{arxiv.2602.15915,
  title  = {MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering},
  author = {Xianwei Mao and Kai Ye and Sheng Zhou and Nan Zhang and Haikuan Huang and Bin Li and Jiajun Bu},
  journal= {arXiv preprint arXiv:2602.15915},
  year   = {2026}
}