中文

利用场景图进行视觉问答的实证研究

计算机视觉与模式识别 2019-07-30 v1 计算与语言

摘要

视觉问答(Visual QA)近年来引起了广泛关注。尽管已提出多种算法,其中大多数建立在图像与语言特征的不同组合以及多模态注意力与融合之上。本文中,我们受运行于知识图上的传统QA系统启发,研究了一种替代方法。具体而言,我们探究了从图像导出的场景图用于视觉问答:图像被抽象表示为图,节点对应物体实体,边对应物体关系。我们调整了近期提出的图网络(GN)来编码场景图,并根据输入问题执行结构化推理。我们的实证研究表明,场景图已能捕捉图像的本质信息,且图网络有潜力以更简洁的架构超越最先进的视觉问答算法。通过分析GN生成的特征,我们可进一步解释推理过程,这指向了可解释视觉问答的一个有前景的方向。

关键词

引用

@article{arxiv.1907.12133,
  title  = {An Empirical Study on Leveraging Scene Graphs for Visual Question Answering},
  author = {Cheng Zhang and Wei-Lun Chao and Dong Xuan},
  journal= {arXiv preprint arXiv:1907.12133},
  year   = {2019}
}

备注

Accepted as oral presentation at BMVC 2019