中文

从图像池中挖掘答案:迈向基于检索的视觉问答

计算机视觉与模式识别 2023-06-30 v1 人工智能 机器学习

摘要

我们研究这样一种设定下的视觉问答:答案必须从给定作为上下文的相关与无关图像池中挖掘。对于此类设定,模型必须首先从图像池中检索相关图像,并基于这些检索到的图像回答问题。我们将此问题称为基于检索的视觉问答(简称 RETVQA)。RETVQA 与传统研究的视觉问答(VQA)明显不同且更具挑战性,在传统 VQA 中,给定问题需结合上下文中单张相关图像作答。为解决 RETVQA 任务,我们提出统一的多图像 BART(MI-BART),其利用我们的相关性编码器接收问题和检索到的图像以生成自由形式的流畅答案。此外,我们引入了该领域最大的数据集,即 RETVQA,其具有以下显著特征:VQA 的多图像与检索需求、基于异构图像池的独立于元数据的提问、期望分类导向与开放式生成答案的混合。我们提出的框架在提出的 RETVQA 数据集上取得了 76.5% 的准确率和 79.3% 的流畅度,并且在公开可用的 WebQA 数据集的图像部分上,分别于准确率和流畅度指标上以 4.9% 和 11.8% 优于最先进(SOTA)方法。

关键词

引用

@article{arxiv.2306.16713,
  title  = {Answer Mining from a Pool of Images: Towards Retrieval-Based Visual Question Answering},
  author = {Abhirama Subramanyam Penamakuri and Manish Gupta and Mithun Das Gupta and Anand Mishra},
  journal= {arXiv preprint arXiv:2306.16713},
  year   = {2023}
}

备注

Accepted to IJCAI 2023