中文

FilterRAG:用于缓解 VQA 中幻觉现象的零样态信息检索增强生成

计算机视觉与模式识别 2026-01-27 v3 计算与语言 信息检索 机器学习

摘要

视觉问答需要模型通过整合视觉和文本理解来生成准确答案。然而,VQA 模型仍在知识驱动和分布外场景中难以避免幻觉,产生令人信服的错误答案。我们引入 FilterRAG,一种检索增强框架,将 BLIP-VQA 与检索增强生成相结合,以在外部知识源(如 Wikipedia 和 DBpedia)中对答案进行 grounding。FilterRAG 在 OK-VQA 数据集上实现了 36.5% 的准确率,展示了其在缓解幻觉和提升内域和分布外设置中鲁棒性的有效性。这些发现凸显了 FilterRAG 改进实际应用中视觉问答系统潜力的重要性。

关键词

引用

@article{arxiv.2502.18536,
  title  = {FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA},
  author = {Nobin Sarwar},
  journal= {arXiv preprint arXiv:2502.18536},
  year   = {2026}
}

备注

12 pages, 6 figures and 2 tables; Accepted at ICCV 2025 Workshop on Building Foundation Models You Can Trust (T2FM)