了解你的目标:目标感知 Transformer 实现更优的时空视频定位
计算机视觉与模式识别
2025-02-18 v1 人工智能
摘要
Transformer 因其端到端流水线和有前景的结果,在时空视频定位(STVG)中引起了越来越多的关注。现有的基于 Transformer 的 STVG 方法通常利用一组目标查询,这些查询简单地使用零初始化,然后通过与多模态特征的迭代交互逐渐学习目标位置信息,以实现空间和时间定位。尽管简单,这些零初始化目标查询由于缺乏目标特定线索,在复杂场景(如存在干扰物或遮挡)中难以从与多模态特征的交互中学习到判别性目标信息,导致性能下降。为解决这一问题,我们提出了一种新颖的面向时空视频定位的目标感知 Transformer(TA-STVG),旨在通过探索给定视频-文本对中的目标特定线索来自适应地生成目标查询,从而改进 STVG。关键在于两个简单而有效的模块:文本引导的时间采样(TTS)和属性感知的空间激活(ASA),它们级联工作。前者侧重于利用整体文本信息从视频中选择与目标相关的时间线索,后者旨在进一步利用先前目标感知时间线索中的细粒度视觉属性信息,用于目标查询初始化。与现有利用零初始化查询的方法不同,我们 TA-STVG 中的目标查询直接来自给定的视频-文本对,自然携带目标特定线索,使其具有自适应性,并能更好地与多模态特征交互以学习更多判别性信息,从而改进 STVG。我们在三个基准上的实验表明,TA-STVG 达到了最先进性能并显著优于基线,验证了其有效性。
引用
@article{arxiv.2502.11168,
title = {Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding},
author = {Xin Gu and Yaojie Shen and Chenxi Luo and Tiejian Luo and Yan Huang and Yuewei Lin and Heng Fan and Libo Zhang},
journal= {arXiv preprint arXiv:2502.11168},
year = {2025}
}