面向检索增强视觉问答的细粒度后期交互多模态检索
计算与语言
2023-10-31 v2 计算机视觉与模式识别
摘要
基于知识的视觉问答(KB-VQA)要求 VQA 系统利用外部知识库中的知识来回答视觉接地问题。检索增强视觉问答(RA-VQA)是解决 KB-VQA 的一种强框架,它首先使用稠密段落检索(DPR)检索相关文档,然后利用这些文档回答问题。本文提出细粒度后期交互多模态检索(FLMR),显著改进了 RA-VQA 中的知识检索。FLMR 解决了 RA-VQA 检索器的两个主要局限:(1)通过图像到文本变换获得的图像表示可能不完整且不准确;(2)查询与文档之间的相关性分数使用一维嵌入计算,可能对更细粒度的相关性不敏感。FLMR 通过使用视觉模型获得补充图像到文本变换表示的图像表示来克服这些局限,该视觉模型通过简单对齐网络与现有基于文本的检索器对齐。FLMR 还使用多维嵌入对图像和问题进行编码,以捕捉查询与文档之间更细粒度的相关性。FLMR 将原始 RA-VQA 检索器的 PRRecall@5 显著提升了约 8%。最后,我们为 RA-VQA 配备了两个最先进的大型多模态/语言模型,在 OK-VQA 数据集上取得了约 61% 的 VQA 分数。
引用
@article{arxiv.2309.17133,
title = {Fine-grained Late-interaction Multi-modal Retrieval for Retrieval Augmented Visual Question Answering},
author = {Weizhe Lin and Jinghong Chen and Jingbiao Mei and Alexandru Coca and Bill Byrne},
journal= {arXiv preprint arXiv:2309.17133},
year = {2023}
}
备注
To appear at NeurIPS 2023. This is the camera-ready version. We fixed some numbers and added more experiments to address reviewers' comments