中文

EchoSight:通过 Wiki 知识 advancing视觉语言模型

计算机视觉与模式识别 2024-12-03 v4

摘要

基于知识的视觉问答(KVQA)任务需要使用广泛的背景知识来回答关于图像的问题。尽管取得了显著进展,但生成模型常因外部知识集成有限而在这些任务上困难。本文引入 EchoSight,一种新型多模态检索增强生成(RAG)框架,使大型语言模型(LLMs)能够回答需要精细百科知识的视觉问题。为实现高性能检索,EchoSight 首先仅使用视觉信息搜索 wiki 文章,随后根据其与组合文本-图像查询的相关性对这些候选文章进行重新排序。这种方法显著提高了多模态知识的集成,导致检索结果更佳以及更准确的 VQA 回答。我们的实验结果在 Encyclopedic VQA 和 InfoSeek 数据集上表明,EchoSight 在知识基础 VQA 中建立了新的最先进成果,分别实现了 Encyclopedic VQA 和 InfoSeek 的准确率分别为 41.8% 和 31.3%。

关键词

引用

@article{arxiv.2407.12735,
  title  = {EchoSight: Advancing Visual-Language Models with Wiki Knowledge},
  author = {Yibin Yan and Weidi Xie},
  journal= {arXiv preprint arXiv:2407.12735},
  year   = {2024}
}

备注

Accepted by EMNLP 2024 findings; Project Page: https://go2heart.github.io/echosight