EchoSight:通过 Wiki 知识 advancing视觉语言模型
计算机视觉与模式识别
2024-12-03 v4
摘要
基于知识的视觉问答(KVQA)任务需要使用广泛的背景知识来回答关于图像的问题。尽管取得了显著进展,但生成模型常因外部知识集成有限而在这些任务上困难。本文引入 EchoSight,一种新型多模态检索增强生成(RAG)框架,使大型语言模型(LLMs)能够回答需要精细百科知识的视觉问题。为实现高性能检索,EchoSight 首先仅使用视觉信息搜索 wiki 文章,随后根据其与组合文本-图像查询的相关性对这些候选文章进行重新排序。这种方法显著提高了多模态知识的集成,导致检索结果更佳以及更准确的 VQA 回答。我们的实验结果在 Encyclopedic VQA 和 InfoSeek 数据集上表明,EchoSight 在知识基础 VQA 中建立了新的最先进成果,分别实现了 Encyclopedic VQA 和 InfoSeek 的准确率分别为 41.8% 和 31.3%。
引用
@article{arxiv.2407.12735,
title = {EchoSight: Advancing Visual-Language Models with Wiki Knowledge},
author = {Yibin Yan and Weidi Xie},
journal= {arXiv preprint arXiv:2407.12735},
year = {2024}
}
备注
Accepted by EMNLP 2024 findings; Project Page: https://go2heart.github.io/echosight