中文

它存在于何处:面向多形式句子的时空视频定位

计算机视觉与模式识别 2020-03-26 v3

摘要

本文考虑一项新任务:面向多形式句子的时空视频定位(STVG)。给定一段未裁剪视频和一句描述某物体的陈述句/疑问句,STVG 旨在定位所查询物体的时空管。STVG 有两个具有挑战性的设定:(1)我们需要从未裁剪视频中定位时空物体管,其中物体可能仅存在于视频的极短片段中;(2)我们处理多形式句子,包括含显式物体的陈述句和含未知物体的疑问句。现有方法因无效的管预生成以及缺乏物体关系建模而无法应对 STVG 任务。为此,我们提出一种新颖的时空图推理网络(STGRN)用于该任务。首先,我们构建时空区域图以捕捉具有时间物体动态的区域关系,其包含每帧中的隐式与显式空间子图以及跨帧的时间动态子图。随后我们将文本线索融入图中并开展多步跨模态图推理。接下来,我们引入带有动态选择方法的时空定位器,无需管预生成即可直接检索时空管。此外,我们基于视频关系数据集 VidOR 贡献了一个大规模视频定位数据集 VidSTG。大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2001.06891,
  title  = {Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form Sentences},
  author = {Zhu Zhang and Zhou Zhao and Yang Zhao and Qi Wang and Huasheng Liu and Lianli Gao},
  journal= {arXiv preprint arXiv:2001.06891},
  year   = {2020}
}

备注

The camera ready version for CVPR 2020