中文

百科式 VQA:关于细粒度类别详细属性的视觉问答

计算机视觉与模式识别 2023-07-25 v2

摘要

我们提出 Encyclopedic-VQA,一个大规模视觉问答(VQA)数据集,其特色是关于细粒度类别与实例的详细属性的视觉问题。它包含 221k 个唯一的问题+答案对,每个配对(最多)5 张图像,总计 1M 个 VQA 样本。此外,我们的数据集带有一个源自 Wikipedia 的受控知识库,标明了支持每个答案的证据。经验上,我们表明我们的数据集对大型视觉+语言模型构成了艰难挑战,因为它们在我们的数据集上表现不佳:PaLI [14] 在 OK-VQA [37] 上是 SOTA,但在我们的数据集上仅达到 13.0% 准确率。此外,我们通过实验表明,可通过为大型模型增补从知识库检索相关信息的机制来在回答我们的百科式问题上取得进展。完美检索的 oracle 实验在我们数据集的单跳部分达到 87.0% 准确率,而自动检索增强原型取得 48.8%。我们相信我们的数据集能赋能未来关于检索增强视觉+语言模型的研究。它可在 https://github.com/google-research/google-research/tree/master/encyclopedic_vqa 获取。

关键词

引用

@article{arxiv.2306.09224,
  title  = {Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories},
  author = {Thomas Mensink and Jasper Uijlings and Lluis Castrejon and Arushi Goel and Felipe Cadar and Howard Zhou and Fei Sha and André Araujo and Vittorio Ferrari},
  journal= {arXiv preprint arXiv:2306.09224},
  year   = {2023}
}

备注

ICCV'23