中文

OK-VQA:一个需要外部知识的视觉问答基准

计算机视觉与模式识别 2019-09-05 v2 计算与语言

摘要

视觉问答(VQA)的理想形式让我们能够在视觉与语言的联合空间中研究推理,并作为场景理解这一 AI 任务的代理。然而,迄今为止大多数 VQA 基准聚焦于简单计数、视觉属性和目标检测等问题,这些不需要超出图像本身的推理或知识。在本文中,我们处理基于知识的视觉问答任务,并提供一个称为 OK-VQA 的基准,其中图像内容不足以回答问题,从而鼓励依赖外部知识资源的方法。我们的新数据集包含超过 14000 个需要外部知识才能回答的问题。我们表明,最先进的 VQA 模型在这一新设定下的性能急剧下降。我们的分析显示,与先前基于知识的 VQA 数据集相比,我们的基于知识的 VQA 任务具有多样性、困难性且规模更大。我们希望该数据集能使研究者开辟该领域研究的新途径。参见 http://okvqa.allenai.org 下载并浏览数据集。

关键词

引用

@article{arxiv.1906.00067,
  title  = {OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge},
  author = {Kenneth Marino and Mohammad Rastegari and Ali Farhadi and Roozbeh Mottaghi},
  journal= {arXiv preprint arXiv:1906.00067},
  year   = {2019}
}

备注

CVPR 2019