中文

基于实体-属性图匹配与推理的视觉问答

计算机视觉与模式识别 2019-03-19 v1

摘要

视觉问答(VQA)在为用户提供便利方面具有重要意义:人们可以针对图像中物体的细节或场景的高层理解提出问题。本文提出一种解决VQA问题的新方法。与先前工作不同,我们的方法面向单场景VQA,依赖于基于图的技术并涉及推理。简而言之,我们的方法以三个图为核心。第一个图称为推理图GI,通过有标签数据的学习构建。另外两个图称为查询图Q和实体-属性图GEA,分别由用户给出的自然语言查询Qnl和图像Img生成。由于GEA通常不包含足够的信息来回答Q,我们开发了利用GI推断GEA缺失信息的技术。基于GEA和Q,我们提供了在GEA中寻找Q匹配项的技术,作为Img中Qnl的答案。与常用的基于端到端神经网络的VQA方法不同,我们的基于图的方法展现出精心设计的推理能力,因此具有高度可解释性。我们还创建了一个带有丰富标注的足球比赛数据集(Soccer-VQA)。实验结果表明,我们的方法优于当前最优(state-of-the-art)方法,并具有很高的进一步研究潜力。

关键词

引用

@article{arxiv.1903.06994,
  title  = {Visual Query Answering by Entity-Attribute Graph Matching and Reasoning},
  author = {Peixi Xiong and Huayi Zhan and Xin Wang and Baivab Sinha and Ying Wu},
  journal= {arXiv preprint arXiv:1903.06994},
  year   = {2019}
}