中文

面向视觉问答的关系感知图注意力网络

计算机视觉与模式识别 2019-10-11 v3 人工智能

摘要

为了回答关于图像的语义复杂问题,视觉问答(VQA)模型需要充分理解图像中的视觉场景,尤其是不同对象之间的交互动态。我们提出了一种关系感知图注意力网络(ReGAT),它将每张图像编码为图,并通过图注意力机制对多类型对象间关系进行建模,以学习问题自适应的关系表示。我们探索了两类视觉对象关系:(i)显式关系,表示对象之间的几何位置和语义交互;(ii)隐式关系,捕捉图像区域之间的隐藏动态。实验表明,ReGAT 在 VQA 2.0 和 VQA-CP v2 数据集上均优于先前的 state-of-the-art 方法。我们进一步表明,ReGAT 与现有 VQA 架构兼容,并可作为通用关系编码器以提升 VQA 的模型性能。

关键词

引用

@article{arxiv.1903.12314,
  title  = {Relation-Aware Graph Attention Network for Visual Question Answering},
  author = {Linjie Li and Zhe Gan and Yu Cheng and Jingjing Liu},
  journal= {arXiv preprint arXiv:1903.12314},
  year   = {2019}
}

备注

To appear in ICCV 2019