面向场景图生成与人-物交互检测的统一Transformer框架
计算机视觉与模式识别
2023-11-06 v1
摘要
场景图生成(SGG)与人-物交互(HOI)检测是两项重要的视觉任务,分别旨在定位并识别物体之间的关系以及人与物体之间的交互。现有主流工作将这两项任务视为独立任务,导致针对各自数据集开发了特定的任务专用模型。然而,我们认为视觉关系的存在能够提供关键的上下文与复杂的关系线索,从而显著增强人-物交互的推断。这促使我们思考两项任务之间是否存在天然的内在联系,即场景图可作为推断人-物交互的来源。有鉴于此,我们提出了 SG2HOI+,一种基于 Transformer 架构的统一一步模型。我们的方法采用两个交互式分层 Transformer 无缝统一 SGG 与 HOI 检测任务。具体而言,我们首先启动一个关系 Transformer,负责从一组视觉特征中生成关系三元组。随后,我们采用另一个基于 Transformer 的解码器,基于所生成的关系三元组预测人-物交互。在 Visual Genome、V-COCO 和 HICO-DET 等已有基准数据集上开展的一系列全面实验表明,与主流的单阶段 SGG 模型相比,我们的 SG2HOI+ 模型性能优异。值得注意的是,与最先进的 HOI 方法相比,我们的方法取得了具竞争力的性能。此外,我们观察到,以端到端方式在 SGG 与 HOI 任务上联合训练的 SG2HOI+ 相较于单独训练范式,对两项任务均带来了显著提升。
引用
@article{arxiv.2311.01755,
title = {Towards a Unified Transformer-based Framework for Scene Graph Generation and Human-object Interaction Detection},
author = {Tao He and Lianli Gao and Jingkuan Song and Yuan-Fang Li},
journal= {arXiv preprint arXiv:2311.01755},
year = {2023}
}