SGTR+:基于 Transformer 的端到端场景图生成
计算机视觉与模式识别
2024-01-24 v1 人工智能
摘要
由于其组合特性,场景图生成 (SGG) 仍然是一项具有挑战性的视觉理解任务。以往的大多数工作采用自下而上的两阶段方法或基于点的单阶段方法,这些方法常常面临较高的时间复杂度或次优设计的问题。在本工作中,我们提出了一种新颖的 SGG 方法来解决上述问题,将该任务表述为二部图构建问题。为了解决上述问题,我们创建了一个基于 Transformer 的端到端框架来生成实体和实体感知谓词候选集,并推断有向边以形成关系三元组。此外,我们设计了一个图组装模块,基于我们的实体感知结构推断二部场景图的连通性,使我们能够以端到端的方式生成场景图。基于二部图组装范式,我们进一步提出了一种新的技术设计,以解决实体感知建模的有效性和图组装的优化稳定性问题。凭借增强的实体感知设计,我们的方法实现了最优的性能和时间复杂度。大量实验结果表明,我们的设计能够在三个具有挑战性的基准上实现 SOTA 或可比的性能,超越了大多数现有方法,并在推理中享有更高的效率。代码可用:https://github.com/Scarecrow0/SGTR
引用
@article{arxiv.2401.12835,
title = {SGTR+: End-to-end Scene Graph Generation with Transformer},
author = {Rongjie Li and Songyang Zhang and Xuming He},
journal= {arXiv preprint arXiv:2401.12835},
year = {2024}
}
备注
Accepted by TPAMI: https://ieeexplore.ieee.org/document/10315230