中文

基于外部知识的对象级检索用于视觉问答

计算机视觉与模式识别 2025-07-01 v2

摘要

检索增强生成(RAG)技术在问答领域发挥着关键作用,因为大型语言模型(LLM)拥有的知识是有限的,且无法持续更新。目前大多数RAG研究主要聚焦于文本或大尺度图像检索,这限制了RAG模型的更广泛应用。我们认识到,针对超出图像内容范围的提问,对象级检索对于解决此类问题至关重要。为解决这一问题,我们提出了一种名为对象检索用于视觉问答伴随外部知识(OR-OK-VQA)的任务,旨在结合LLM扩展图像基础内容理解。此任务的关键挑战在于检索 diverse objects相关的图像以帮助解答问题。为实现准确且稳健的对象级检索,有必要学习局部对象的嵌入表示。本文引入一种新型无监督深度特征嵌入技术,称为多尺度群体协作嵌入学习(MS-GCEL),用于学习长尾不同尺度对象的嵌入。此外,我们使用来自BelgaLogos、Visual Genome和LVIS数据集的图像建立了OK-VQA评估基准。在OK-VQA评估之前,我们构建了一个利用从COCO 2017和VOC 2007数据集中提取的objects构成的挑战基准,以支持训练和评估通用对象检索模型。我们在通用对象检索和OK-VQA两个方面的评估结果表明,所提出的方法有效。代码和数据集将对以后研究公开释放。

关键词

引用

@article{arxiv.2403.10798,
  title  = {Object Retrieval for Visual Question Answering with Outside Knowledge},
  author = {Shichao Kan and Yuhai Deng and Jiale Fu and Lihui Cen and Zhe Qu and Linna Zhang and Yixiong Liang and Yigang Cen},
  journal= {arXiv preprint arXiv:2403.10798},
  year   = {2025}
}