中文

STVGFormer:基于静态-动态跨模态理解的时空视频定位

计算机视觉与模式识别 2022-07-07 v1

摘要

在本技术报告中,我们介绍了面向以人为中心的时空视频定位任务的解决方案。我们提出了一种简洁有效的框架 STVGFormer,其通过静态分支和动态分支对时空视觉-语言依赖进行建模。静态分支在单帧内执行跨模态理解,并根据帧内视觉线索(如物体外观)学习在空间上定位目标物体。动态分支跨多帧执行跨模态理解,并根据动态视觉线索(如运动)学习预测目标时刻的起止时间。静态与动态分支均设计为跨模态 transformer。我们进一步设计了一种新颖的静态-动态交互模块,使两分支能够相互传递有用且互补的信息,实验表明其能有效改善困难样本的预测。我们所提方法取得了 39.6% 的 vIoU,并在第四届 Person in Context 挑战赛的 HC-STVG 赛道中获得第一名。

关键词

引用

@article{arxiv.2207.02756,
  title  = {STVGFormer: Spatio-Temporal Video Grounding with Static-Dynamic Cross-Modal Understanding},
  author = {Zihang Lin and Chaolei Tan and Jian-Fang Hu and Zhi Jin and Tiancai Ye and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2207.02756},
  year   = {2022}
}

备注

Technical report. The 1st place solution in the HC-STVG track of the 4th Person in Context Challenge(2022)