BGT-Net:用于场景图生成的双向GRU Transformer网络
计算机视觉与模式识别
2021-09-14 v1 人工智能
摘要
场景图由物体节点与物体-物体关系边组成。场景图生成(SGG)旨在识别物体及其关系。我们提出了一种用于图像场景图生成的双向GRU(BiGRU) Transformer网络(BGT-Net)。该模型通过BiGRU层实现新颖的物体-物体通信以增强物体信息。因此,图像中所有物体的信息对其他物体均可用,可在后续的物体预测步骤中加以利用。该物体信息被送入一个Transformer编码器以预测物体类别,并通过另一个Transformer编码器生成物体特定的边信息。为处理由长尾关系分布引发的数据集偏置,采用log-softmax函数软化并对每个关系预测单独添加偏置自适应项以调节偏置,被证明是一种有效方法。我们利用开源数据集(即Visual Genome、Open-Images与Visual Relationship Detection数据集)进行了详尽的实验与消融研究,证明了所提模型优于当前最优方法。
引用
@article{arxiv.2109.05346,
title = {BGT-Net: Bidirectional GRU Transformer Network for Scene Graph Generation},
author = {Naina Dhingra and Florian Ritter and Andreas Kunz},
journal= {arXiv preprint arXiv:2109.05346},
year = {2021}
}
备注
8 pages, 7 supplementary pages