中文

SGTR:基于 Transformer 的端到端场景图生成

计算机视觉与模式识别 2022-04-01 v3 机器学习

摘要

场景图生成(SGG)因其组合特性仍是一项具有挑战性的视觉理解任务。多数已有工作采用自底向上的两阶段或基于点的单阶段方法,常受限于高时间复杂度或次优设计。本工作中,我们提出一种新颖的 SGG 方法以解决上述问题,将该任务表述为二部图构建问题。为解决此问题,我们开发了基于 transformer 的端到端框架,其首先生成实体与谓词提议集,随后推断有向边以形成关系三元组。特别地,我们基于利用关系组合特性的结构化谓词生成器,开发了一种新的实体感知谓词表示。此外,我们设计了一个图组装模块,基于我们的实体感知结构推断二部场景图的连通性,使我们能够以端到端方式生成场景图。大量实验结果表明,我们的设计在两个具挑战性的基准上能够达到最先进(SOTA)或可比性能,超越多数现有方法,并在推理中享有更高效率。我们希望我们的模型可作为基于 Transformer 的场景图生成的强基线。代码见:https://github.com/Scarecrow0/SGTR

关键词

引用

@article{arxiv.2112.12970,
  title  = {SGTR: End-to-end Scene Graph Generation with Transformer},
  author = {Rongjie Li and Songyang Zhang and Xuming He},
  journal= {arXiv preprint arXiv:2112.12970},
  year   = {2022}
}

备注

Accepted by CVPR2022