SGTR:基于 Transformer 的端到端场景图生成
计算机视觉与模式识别
2022-04-01 v3 机器学习
摘要
场景图生成(SGG)因其组合特性仍是一项具有挑战性的视觉理解任务。多数已有工作采用自底向上的两阶段或基于点的单阶段方法,常受限于高时间复杂度或次优设计。本工作中,我们提出一种新颖的 SGG 方法以解决上述问题,将该任务表述为二部图构建问题。为解决此问题,我们开发了基于 transformer 的端到端框架,其首先生成实体与谓词提议集,随后推断有向边以形成关系三元组。特别地,我们基于利用关系组合特性的结构化谓词生成器,开发了一种新的实体感知谓词表示。此外,我们设计了一个图组装模块,基于我们的实体感知结构推断二部场景图的连通性,使我们能够以端到端方式生成场景图。大量实验结果表明,我们的设计在两个具挑战性的基准上能够达到最先进(SOTA)或可比性能,超越多数现有方法,并在推理中享有更高效率。我们希望我们的模型可作为基于 Transformer 的场景图生成的强基线。代码见:https://github.com/Scarecrow0/SGTR
引用
@article{arxiv.2112.12970,
title = {SGTR: End-to-end Scene Graph Generation with Transformer},
author = {Rongjie Li and Songyang Zhang and Xuming He},
journal= {arXiv preprint arXiv:2112.12970},
year = {2022}
}
备注
Accepted by CVPR2022