中文

基于知识的VQA中的知识凝练与推理

计算机视觉与模式识别 2024-03-18 v1

摘要

基于知识的视觉问答(KB-VQA)是一项具有挑战性的任务,它要求模型利用外部知识来理解并回答基于视觉内容的问题。最近的研究从外部知识库中检索知识段落,然后使用它们来回答问题。然而,这些检索到的知识段落通常包含不相关或噪声信息,这限制了模型的性能。为了应对这一挑战,我们提出了两个协同模型:知识凝练模型和知识推理模型。我们从两个角度凝练检索到的知识段落。首先,我们利用视觉-语言模型的多模态感知和推理能力,从检索到的冗长段落中提炼出简洁的知识概念,确保与视觉内容和问题的相关性。其次,我们利用大型语言模型的文本理解能力,将段落总结和凝练成有助于回答问题的知识精华。这两种凝练后的知识随后被无缝集成到我们的知识推理模型中,该模型明智地导航通过合并的信息以得出最终答案。大量实验验证了所提出方法的优越性。与先前方法相比,我们的方法在基于知识的VQA数据集上(OK-VQA上65.1%,A-OKVQA上60.1%)实现了最先进的性能,而无需借助GPT-3(175B)产生的知识。

关键词

引用

@article{arxiv.2403.10037,
  title  = {Knowledge Condensation and Reasoning for Knowledge-based VQA},
  author = {Dongze Hao and Jian Jia and Longteng Guo and Qunbo Wang and Te Yang and Yan Li and Yanhua Cheng and Bo Wang and Quan Chen and Han Li and Jing Liu},
  journal= {arXiv preprint arXiv:2403.10037},
  year   = {2024}
}