中文

拥抱一致性:一种用于时空视频定位的单阶段方法

计算机视觉与模式识别 2022-12-02 v2

摘要

时空视频定位(STVG)致力于检索由自由形式文本表达式所描述的特定对象的时空管。现有方法主要将此复杂任务视为并行的逐帧定位问题,因而遭受两类不一致缺陷:特征对齐不一致与预测不一致。本文提出一种端到端单阶段框架,称为时空一致性感知 Transformer(STCAT),以缓解这些问题。具体而言,我们引入一种新颖的多模态模板作为全局目标来处理该任务,其显式约束定位区域并关联所有视频帧间的预测。此外,为了在充分的视频-文本感知下生成上述模板,我们提出了一种编码器-解码器架构以进行有效全局上下文建模。得益于这些关键设计,STCAT 享有更一致的跨模态特征对齐与管预测,且无需依赖任何预训练目标检测器。大量实验表明,我们的方法在两个具有挑战性的视频基准(VidSTG 与 HC-STVG)上以明显优势超越先前的最先进方法,展示了所提框架在更好理解视觉与自然语言之间关联方面的优越性。代码已公开于 https://github.com/jy0205/STCAT。

关键词

引用

@article{arxiv.2209.13306,
  title  = {Embracing Consistency: A One-Stage Approach for Spatio-Temporal Video Grounding},
  author = {Yang Jin and Yongzhi Li and Zehuan Yuan and Yadong Mu},
  journal= {arXiv preprint arXiv:2209.13306},
  year   = {2022}
}

备注

18 pages, 7 figures, Accepted by Neurips 2022, Spotlight Presentation