STPro:用于弱监督时空定位的时空渐进式学习
计算机视觉与模式识别
2025-04-08 v2
摘要
在本工作中,我们研究了弱监督时空视频定位,这是一项具有挑战性的任务,仅使用文本查询且无边界框监督,在视频中对目标主体进行时空定位。受视觉-语言基础模型最新进展的启发,我们利用其零样本定位能力研究了它们在 WSTVG 中的效用。然而,我们发现简单的适配缺乏基本的时空定位能力。为了弥合这一差距,我们引入了 Tubelet Referral Grounding (TRG),它将文本查询与 tubelet 相连接以实现时空预测。尽管 TRG 很有前景,但在组合动作理解和密集场景下仍存在困难。为了解决这些局限性,我们提出了 STPro,一种新颖的渐进式学习框架,包含两个关键模块:(1) 子动作时间课程学习,逐步构建组合动作理解能力;(2) 拥塞引导的空间课程学习,通过在空间上增加任务难度使模型适应复杂场景。STPro 在三个基准数据集上取得了最先进的结果,在 VidSTG-Declarative 上提升了 1.0%,在 HCSTVG-v1 上提升了 3.0%。
引用
@article{arxiv.2502.20678,
title = {STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding},
author = {Aaryan Garg and Akash Kumar and Yogesh S Rawat},
journal= {arXiv preprint arXiv:2502.20678},
year = {2025}
}
备注
CVPR'25 Conference