中文

BGT-Net:用于场景图生成的双向GRU Transformer网络

计算机视觉与模式识别 2021-09-14 v1 人工智能

摘要

场景图由物体节点与物体-物体关系边组成。场景图生成(SGG)旨在识别物体及其关系。我们提出了一种用于图像场景图生成的双向GRU(BiGRU) Transformer网络(BGT-Net)。该模型通过BiGRU层实现新颖的物体-物体通信以增强物体信息。因此,图像中所有物体的信息对其他物体均可用,可在后续的物体预测步骤中加以利用。该物体信息被送入一个Transformer编码器以预测物体类别,并通过另一个Transformer编码器生成物体特定的边信息。为处理由长尾关系分布引发的数据集偏置,采用log-softmax函数软化并对每个关系预测单独添加偏置自适应项以调节偏置,被证明是一种有效方法。我们利用开源数据集(即Visual Genome、Open-Images与Visual Relationship Detection数据集)进行了详尽的实验与消融研究,证明了所提模型优于当前最优方法。

关键词

引用

@article{arxiv.2109.05346,
  title  = {BGT-Net: Bidirectional GRU Transformer Network for Scene Graph Generation},
  author = {Naina Dhingra and Florian Ritter and Andreas Kunz},
  journal= {arXiv preprint arXiv:2109.05346},
  year   = {2021}
}

备注

8 pages, 7 supplementary pages