中文

基于句子删除的上下文一致性学习用于半监督视频段落定位

计算机视觉与模式识别 2025-06-24 v1

摘要

半监督视频段落定位(SSVPG)旨在从未裁剪的视频中定位段落中多个句子,仅使用有限的时序标注。现有方法侧重于教师-学生一致性学习和视频级别对比损失,但忽视了扰动查询上下文以生成强监督信号的重要性。在本工作中,我们提出了一种新型的 Context Consistency Learning(CCL)框架,将一致性正则化和伪标签化范式统一,以增强半监督学习。具体而言,我们首先进行教师-学生学习,其中学生模型以删除句子后的强增广样本为输入,并受到来自教师模型的充分强监督信号的约束。随后,我们基于生成的伪标签进行模型再训练,其中原始视图和增广视图的预测之间的相互一致性被用作标签置信度。大量实验表明,CCL 明显优于现有方法。

关键词

引用

@article{arxiv.2506.18476,
  title  = {Context Consistency Learning via Sentence Removal for Semi-Supervised Video Paragraph Grounding},
  author = {Yaokun Zhong and Siyu Jiang and Jian Zhu and Jian-Fang Hu},
  journal= {arXiv preprint arXiv:2506.18476},
  year   = {2025}
}

备注

Accepted by ICME2025