中文

面向视觉常识推理的异质图学习

计算机视觉与模式识别 2019-10-28 v1

摘要

视觉常识推理任务旨在引导研究领域解决认知层面的推理,具备预测正确答案并同时提供令人信服的推理路径的能力,由此产生三个子任务,即 Q->A、QA->R 和 Q->AR。它在视觉与语言领域间的恰当语义对齐以及生成有说服力的推理路径的知识推理方面带来了巨大挑战。现有工作要么诉诸强大的端到端网络而无法产生可解释的推理路径,要么仅探索视觉对象内部关系(同质图)而忽略了视觉概念与语言词汇间的跨域语义对齐。在本文中,我们提出一种新的异质图学习(HGL)框架,用于无缝整合图内与图间推理,以桥接视觉与语言领域。我们的 HGL 由一个原始视觉到答案异质图(VAHG)模块和一个双重问题到答案异质图(QAHG)模块组成,以交互式地精炼推理路径以实现语义一致。此外,我们的 HGL 整合了一个上下文投票模块,以利用长程视觉上下文实现更好的全局推理。在大规模视觉常识推理基准上的实验证明了我们提出的模块在三个任务上的优越性能(在 Q->A 上提升 5% 准确率,在 QA->R 上提升 3.5%,在 Q->AR 上提升 5.8%)。

关键词

引用

@article{arxiv.1910.11475,
  title  = {Heterogeneous Graph Learning for Visual Commonsense Reasoning},
  author = {Weijiang Yu and Jingwen Zhou and Weihao Yu and Xiaodan Liang and Nong Xiao},
  journal= {arXiv preprint arXiv:1910.11475},
  year   = {2019}
}

备注

11 pages, 5 figures