中文

DSGG:用于端到端场景图生成的稠密关系 Transformer

计算机视觉与模式识别 2024-03-25 v1

摘要

场景图生成旨在捕获图像中物体之间详细的空间和语义关系,由于标注不完整、长尾关系类别以及关系语义重叠,这具有挑战性。现有的基于 Transformer 的方法要么对物体和谓词使用不同的查询,要么对关系三元组使用整体查询,因此通常在学习低频关系时能力有限。在本文中,我们提出了一种新的基于 Transformer 的方法,称为 DSGG,该方法将场景图检测视为基于一组独特的图感知查询的直接图预测问题。具体而言,每个图感知查询编码了图中节点及其所有关系的紧凑表示,这是在训练过程中通过利用松弛子图匹配获得的。此外,为了解决关系语义重叠问题,我们采用关系蒸馏策略,旨在高效学习语义关系的多个实例。在 VG 和 PSG 数据集上的大量实验表明,我们的模型取得了 SOTA 结果,在场景图生成任务的 mR@50 和 mR@100 上分别显著提升了 3.5% 和 6.7%,在全景场景图生成任务的 mR@50 和 mR@100 上分别取得了 8.5% 和 10.3% 的更大提升。代码可在 \url{https://github.com/zeeshanhayder/DSGG} 获取。

关键词

引用

@article{arxiv.2403.14886,
  title  = {DSGG: Dense Relation Transformer for an End-to-end Scene Graph Generation},
  author = {Zeeshan Hayder and Xuming He},
  journal= {arXiv preprint arXiv:2403.14886},
  year   = {2024}
}

备注

Accepted by CVPR 2024