面向检索增强视觉问答的协作参数化知识校准
计算机视觉与模式识别
2026-05-20 v2 信息检索
多媒体
摘要
知识基准视觉问答 (KB-VQA) 系统解决复杂的视觉 grounding questions,需从外部知识库中检索相关知识。知识检索和答案生成任务均需要精确的多模态理解 question context 和外部知识。然而,现有方法在训练期将这两个阶段视为独立模块,interaction 有限,这阻碍了双向参数化知识共享,最终导致次优性能。为充分挖掘 KB-VQA 中的 cross-task synergy,我们提出一种协作参数化知识校准的统一检索增强 VQA 框架。该框架能够有效适配 general multimodal pre-trained models 以执行精细的、知识密集型任务,同时使 retriever 和 generator 在训练和推理期间协作增强和共享其参数化知识。为增强对问题和外部文档的细粒度理解,我们还将 late interaction mechanism 集成到该训练框架中。此外,我们引入一种 reflective-answering mechanism,使模型能够显式评估和细化其 knowledge boundary。我们的方法在 state-of-the-art 模型 baseline 上取得竞争性性能,实现了 4.7% 的 answer accuracy 提升,并为 base MLLMs 的 VQA 性能带来平均 7.5% 的提升。
引用
@article{arxiv.2504.04065,
title = {Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering},
author = {Jiaqi Deng and Kaize Shi and Zonghan Wu and Huan Huo and Dingxian Wang and Guandong Xu},
journal= {arXiv preprint arXiv:2504.04065},
year = {2026}
}
备注
10 pages, 5 figures, Under Review