中文

用于动态场景图生成的时空 Transformer

计算机视觉与模式识别 2021-08-10 v2

摘要

动态场景图生成旨在为给定视频生成场景图。与基于图像的场景图生成任务相比,它更具挑战性,因为对象之间的动态关系以及帧间的时间依赖允许更丰富的语义解释。在本文中,我们提出时空 Transformer(STTran),一种由两核心模块组成的神经网络:(1)空间编码器,接收输入帧以提取空间上下文并推理帧内视觉关系;(2)时间解码器,将空间编码器的输出作为输入以捕获帧间时间依赖并推断动态关系。此外,STTran 可灵活接受不定长视频输入而无需裁剪,这对长视频尤为重要。我们的方法在基准数据集 Action Genome(AG)上得到验证。实验结果证明了我们的方法在动态场景图方面的优越性能。此外,进行了一组消融研究并论证了各提出模块的作用。代码见:https://github.com/yrcong/STTran。

关键词

引用

@article{arxiv.2107.12309,
  title  = {Spatial-Temporal Transformer for Dynamic Scene Graph Generation},
  author = {Yuren Cong and Wentong Liao and Hanno Ackermann and Bodo Rosenhahn and Michael Ying Yang},
  journal= {arXiv preprint arXiv:2107.12309},
  year   = {2021}
}

备注

accepted by ICCV 2021