中文

上下文引导的时空视频定位

计算机视觉与模式识别 2024-01-04 v1

摘要

时空视频定位(STVG)任务旨在根据文本查询定位特定实例的时空管。尽管取得了进展,但由于文本提供的对象信息不足,当前方法容易受到视频中干扰物或严重对象外观变化的影响,导致性能下降。针对这一问题,我们提出了一种新颖的框架——上下文引导的STVG(CG-STVG),该框架挖掘视频中对象的判别性实例上下文,并将其作为目标定位的补充指导。CG-STVG的关键在于两个专门设计的模块,包括实例上下文生成(ICG),专注于发现实例的视觉上下文信息(包括外观和运动),以及实例上下文细化(ICR),旨在通过消除上下文中无关甚至有害的信息来改进ICG生成的实例上下文。在定位过程中,ICG和ICR被部署在Transformer架构的每个解码阶段,用于实例上下文学习。特别地,从一个解码阶段学习到的实例上下文被馈送到下一个阶段,并作为包含丰富且判别性对象特征的指导,用于增强解码特征中的目标感知能力,这反过来有利于生成更好的新实例上下文,最终改进定位。与现有方法相比,CG-STVG利用文本查询中的对象信息和挖掘到的实例视觉上下文指导,实现更准确的目标定位。我们在三个基准数据集(包括HCSTVG-v1/-v2和VidSTG)上的实验表明,CG-STVG在所有数据集上的m_tIoU和m_vIoU指标均达到了新的最先进水平,显示了其有效性。代码将在https://github.com/HengLan/CGSTVG发布。

关键词

引用

@article{arxiv.2401.01578,
  title  = {Context-Guided Spatio-Temporal Video Grounding},
  author = {Xin Gu and Heng Fan and Yan Huang and Tiejian Luo and Libo Zhang},
  journal= {arXiv preprint arXiv:2401.01578},
  year   = {2024}
}