中文

关系Transformer网络

计算机视觉与模式识别 2021-07-22 v2

摘要

提取以物体为节点、相互关系为边的场景图是深度理解图像内容的基础。尽管已有消息传递与联合分类等近期进展,视觉关系检测仍因对视觉物体间相互作用探索不佳而具挑战性。本文中,我们提出一种用于场景图生成与关系预测的Transformer新公式。我们利用Transformer的编码器-解码器架构实现节点与边的丰富特征嵌入。具体而言,我们以Transformer编码器的自注意力建模节点间交互,以解码器的交叉注意力建模边到节点交互。此外,我们引入一种适用于解码器中处理边的新位置嵌入。最后,我们的关系预测模块从学到的节点与边嵌入中分类有向关系。我们将此架构命名为关系Transformer网络(RTN)。在Visual Genome与GQA数据集上,我们相较最先进方法分别取得4.85%与3.1%点的整体均值提升。实验表明,Relation Transformer可跨小、中、大规模关系分类的多种数据集高效建模上下文。

关键词

引用

@article{arxiv.2004.06193,
  title  = {Relation Transformer Network},
  author = {Rajat Koner and Suprosanna Shit and Volker Tresp},
  journal= {arXiv preprint arXiv:2004.06193},
  year   = {2021}
}