中文

跳出框架:基于图卷积网络的事实型视觉问答推理

计算机视觉与模式识别 2018-11-02 v1

摘要

准确回答关于给定图像的问题需要将观察与常识相结合。这对人类轻而易举,但利用常识推理仍是算法上的挑战。为推进该方向研究,近来提出了一种新颖的“基于事实的”视觉问答(FVQA)任务,并伴随大量将两实体(即两个可能答案)通过关系相连的精选事实。给定问题-图像对,深度网络技术被用于逐步缩减大量事实,直至预测最终剩余事实的两实体之一为答案。我们观察到一次只考虑一个事实以形成局部决策的连续过程是次优的。相反,我们构建实体图并利用图卷积网络通过联合考虑所有实体来“推理”正确答案。在具挑战性的 FVQA 数据集上,我们展示这相比当前最优水平带来了约 7% 的准确率提升。

关键词

引用

@article{arxiv.1811.00538,
  title  = {Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering},
  author = {Medhini Narasimhan and Svetlana Lazebnik and Alexander G. Schwing},
  journal= {arXiv preprint arXiv:1811.00538},
  year   = {2018}
}

备注

Accepted to NIPS 2018