中文

Graphhopper:用于视觉问答的多跳场景图推理

计算机视觉与模式识别 2021-07-15 v1

摘要

视觉问答(VQA)致力于回答关于图像的任意形式问题。由于它需要对问题有深度的语义和语言理解,并具备将其与图像中存在的各种对象相关联的能力,因此这是一项艰巨的任务,需要从计算机视觉和自然语言处理中进行多模态推理。我们提出 Graphhopper,一种通过整合知识图推理、计算机视觉和自然语言处理技术来处理该任务的新方法。具体而言,我们的方法基于围绕场景实体及其语义和空间关系进行上下文驱动的顺序推理。作为第一步,我们导出描述图像中对象及其属性和相互关系的场景图。随后,训练一个强化学习智能体在提取的场景图上以多跳方式自主导航以生成推理路径,这些路径是推导答案的基础。我们在具有挑战性的数据集 GQA 上基于手动策划和自动生成的场景图进行了实验研究。我们的结果表明,在手动策划的场景图上我们与人类表现持平。此外,我们发现 Graphhopper 在手动策划和自动生成的场景图上均以显著优势优于另一种最先进的场景图推理模型。

关键词

引用

@article{arxiv.2107.06325,
  title  = {Graphhopper: Multi-Hop Scene Graph Reasoning for Visual Question Answering},
  author = {Rajat Koner and Hang Li and Marcel Hildebrandt and Deepan Das and Volker Tresp and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2107.06325},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2007.01072