中文

基于点监督的自然语言视频局部化的协作时序一致性学习

计算机视觉与模式识别 2025-03-25 v1

摘要

自然语言视频局部化(NLVL)是视频理解中的关键任务,旨在根据给定的语言描述定位视频中的目标时刻。最近提出了一种点监督范例,用于解决此任务,仅需目标时刻内单个标注帧而无需完整的时序边界。相较于完全监督范例,后者在局部化精度和标注成本之间提供了平衡。然而,由于缺乏完整标注,难以对齐视频内容与语言描述,从而阻碍准确的时刻预测。为此,我们提出一种新的 COllaborative Temporal consistEncy Learning(COTEL)框架,利用显著性检测与时刻局部化之间的协同作用以强化视频语言对齐。具体而言,我们首先设计了帧级和段级时序一致性学习(TCL)模块,用于建模帧显著性与句子-时刻对之间的语义对齐。随后,我们设计了跨一致性指导方案,包括帧级一致性指导(FCG)和段级一致性指导(SCG),使两种时序一致性学习路径能够相互强化。进一步,我们引入了层次对比对齐损失(HCAL),全面对齐视频和文本查询。大量实验在两个基准数据集上表明,我们的方法在与最先进方法相比时表现优异。我们将发布所有源代码。

关键词

引用

@article{arxiv.2503.17651,
  title  = {Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization},
  author = {Zhuo Tao and Liang Li and Qi Chen and Yunbin Tu and Zheng-Jun Zha and Ming-Hsuan Yang and Yuankai Qi and Qingming Huang},
  journal= {arXiv preprint arXiv:2503.17651},
  year   = {2025}
}

备注

Under review