面向长时段视频的空间-时间视频定位
计算机视觉与模式识别
2026-02-27 v1
摘要
在实际场景中,视频可持续数分钟甚至数小时。然而,现有研究在空间-时间视频定位(STVG)中,鉴于文本查询,主要聚焦于定位持续不到一分钟的短视频中的目标,这限制了实际应用。本文探讨了长时段 STVG(LF-STVG),旨在定位长时段视频中的目标。与短视频相比,长时段视频包含更长的时间跨度和更多无关信息,这使得处理一次性处理所有帧的现有 STVG 方法难以应对。为此,我们提出了用于 LF-STVG 的自回归变换器架构,称为 ART-STVG。不同于常规 STVG 方法需要一次性对整个视频序列作出预测,ART-STVG 将视频视为流式输入,按帧顺序处理,从而高效处理长视频。为建模空间-时间语境,我们设计了空间记忆库和时间记忆库,并将其应用于解码器。由于不同时刻的记忆不始终与当前帧相关,我们引入简单而有效的记忆选择策略,以为解码器提供更相关的信息,显著提升性能。此外,与并行的空间和时间局部化不同,我们提出了级联空间-时间设计,将空间解码器连接至时间解码器,使细粒度的空间线索能够辅助长视频中复杂的时间局部化。在新扩展的 LF-STVG 数据集上进行的实验表明,ART-STVG 在 state-of-the-art 方法之上显著优于,同时在常规短时段 STVG 上实现了具竞争力的性能。
引用
@article{arxiv.2602.23294,
title = {Towards Long-Form Spatio-Temporal Video Grounding},
author = {Xin Gu and Bing Fan and Jiali Yao and Zhipeng Zhang and Yan Huang and Cheng Han and Heng Fan and Libo Zhang},
journal= {arXiv preprint arXiv:2602.23294},
year = {2026}
}