中文

TRKT:基于时空增强关系感知知识迁移的弱监督动态场景图生成

计算机视觉与模式识别 2025-08-08 v1 人工智能

摘要

动态场景图生成(DSGG)旨在为每个视频帧通过检测对象并预测其关系来创建场景图。弱监督 DSGG(WS-DSGG)通过使用单个帧的未定位场景图进行训练来减少标注工作量。现有 WS-DSGG 方法依赖于基于静态、以对象为中心的图像训练的检测器生成伪标签用于后续 DSGG 训练。然而,针对 DSGG 所需的动态、关系感知场景的检测器在训练时表现不佳,导致定位不准确且置信度低的提议。为解决外部检测器在 WS-DSGG 中的问题,我们提出一种时空增强关系感知知识迁移(TRKT)方法,该方法利用知识来增强面向关系感知动态场景的检测。TRKT 由两个关键组件构成:(1)关系感知知识挖掘:我们首先采用对象和关系类别解码器生成类别特定注意力图,以突出对象区域和互动区域。然后我们提出一种跨帧注意力增强策略,利用相邻帧的光流来增强注意力图,使其对运动感知且对运动模糊鲁棒。此步骤为 WS-DSGG 获得关系和运动感知的知识。(2)我们引入双流融合模块,将类别特定注意力图整合到外部检测结果中,以细化对象定位并提升对象提议的置信度。广泛的实验表明,TRKT 在 Action Genome 数据集上实现了最先进的性能。我们的代码已公开 https://github.com/XZPKU/TRKT.git。

关键词

引用

@article{arxiv.2508.04943,
  title  = {TRKT: Weakly Supervised Dynamic Scene Graph Generation with Temporal-enhanced Relation-aware Knowledge Transferring},
  author = {Zhu Xu and Ting Lei and Zhimin Li and Guan Wang and Qingchao Chen and Yuxin Peng and Yang liu},
  journal= {arXiv preprint arXiv:2508.04943},
  year   = {2025}
}