面向视觉问答的关系感知图注意力网络
计算机视觉与模式识别
2019-10-11 v3 人工智能
摘要
为了回答关于图像的语义复杂问题,视觉问答(VQA)模型需要充分理解图像中的视觉场景,尤其是不同对象之间的交互动态。我们提出了一种关系感知图注意力网络(ReGAT),它将每张图像编码为图,并通过图注意力机制对多类型对象间关系进行建模,以学习问题自适应的关系表示。我们探索了两类视觉对象关系:(i)显式关系,表示对象之间的几何位置和语义交互;(ii)隐式关系,捕捉图像区域之间的隐藏动态。实验表明,ReGAT 在 VQA 2.0 和 VQA-CP v2 数据集上均优于先前的 state-of-the-art 方法。我们进一步表明,ReGAT 与现有 VQA 架构兼容,并可作为通用关系编码器以提升 VQA 的模型性能。
引用
@article{arxiv.1903.12314,
title = {Relation-Aware Graph Attention Network for Visual Question Answering},
author = {Linjie Li and Zhe Gan and Yu Cheng and Jingjing Liu},
journal= {arXiv preprint arXiv:1903.12314},
year = {2019}
}
备注
To appear in ICCV 2019