TubeRMC: 基于管束条件重构与相互约束的弱监督时空视频定位
计算机视觉与模式识别
2025-11-21 v2
摘要
时空视频定位 (STVG) 旨在在未剪辑视频中定位与给定语言查询对应的时空管束。这是一项具有挑战性的任务,因为它涉及复杂的视觉语言理解和时空推理。最近的工作探索了 STVG 中的弱监督设置,以消除对细粒度标注如边界框或时间戳的依赖。然而,它们通常遵循简单的后期融合方式,该方式会生成与文本描述无关的管束,常导致目标识别失败和目标跟踪不一致。为解决这一限制,我们提出了 TubeRMC 框架,通过管束条件重构与相互约束来生成文本条件候选管束,并通过管束条件重构进行进一步细化。具体而言,我们设计了三种从时间、空间和时空视角的重构策略,全面捕获丰富的管束-文本对应关系。每种策略都配备有管束条件重构器,利用时空管束作为条件来重构查询中的关键线索。我们进一步引入空间提案与时间提案之间的相互约束,以增强它们的质量以进行重构。TubeRMC 在两个公共基准 VidSTG 和 HCSTVG 上超越了现有方法。进一步的可视化显示,TubeRMC 有效缓解了目标识别错误和不一致跟踪问题。
引用
@article{arxiv.2511.10241,
title = {TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding},
author = {Jinxuan Li and Yi Zhang and Jian-Fang Hu and Chaolei Tan and Tianming Liang and Beihao Xia},
journal= {arXiv preprint arXiv:2511.10241},
year = {2025}
}
备注
Accepted to AAAI 2026