中文

基于语境的自paced学习:弱监督时空视频定位

计算机视觉与模式识别 2025-03-18 v3

摘要

本文聚焦于弱监督时空视频定位(WSTVG)问题。该任务是一种多模态任务,旨在基于文本查询在空间和时间上定位特定主体,同时不依赖边界框监督。受多模态基础模型在定位任务中的最新进展启发,我们首先探索了最先进的对象检测模型在WSTVG中的潜力。尽管它们具备强大的零样学习能力,但我们的改造仍暴露出显著局限性,包括时间预测不一致、对复杂查询理解不足以及在困难情境下的适应性挑战。我们提出了CoSPaL(Contextual Self-Paced Learning),一种新颖的方法,旨� overcome这些局限性。CoSPaL集成了三个核心组件:(1)管束短语定位(TPG),通过将文本查询链接到管束实现空间-时间预测;(2)语境指引定位(CRG),通过提取语境信息在时间上细化对象识别,从而提高对复杂查询的理解;(3)自paced场景理解(SPS),一种逐渐增加任务难度的训练范式,使模型能够通过从粗糙到细粒度的理解过渡,适应复杂情境。

关键词

引用

@article{arxiv.2501.17053,
  title  = {Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding},
  author = {Akash Kumar and Zsolt Kira and Yogesh Singh Rawat},
  journal= {arXiv preprint arXiv:2501.17053},
  year   = {2025}
}

备注

ICLR'25 Main Conference. Project Page: https://akash2907.github.io/cospal_webpage