中文

部分监督时序句子 grounding 的 Contrast-Unity

计算机视觉与模式识别 2025-02-19 v1

摘要

时序句子 grounding 旨在从给定的未剪辑视频中检测由自然语言查询描述的事件时间戳。现有的全监督设置取得了优异成绩,但需要高昂的标注成本;而弱监督设置采用廉价标签但表现不佳。为在追求较低标注成本的同时获得高性能,本文引入一种中间层次的部分监督设置,即仅在训练期间提供短片段标签。为充分利用部分标签,我们特别设计了一个对比-统一(Contrast-Unity)框架,目标分为隐式-显式两阶段的渐进式 grounding。在隐式阶段,我们利用全面的四元组对比学习在细粒度层面对事件-查询表示进行对齐,包括事件-查询聚合、事件-背景分离、簇内紧凑性和簇间可分性。随后,高质量的表示会带来可接受的 grounding 伪标签。在显式阶段,为显式优化 grounding 目标,我们训练一个基于获取的伪标签用于 grounding 精炼和去噪的全监督模型。在 Charades-STA 和 ActivityNet Captions 上的大量实验和彻底的消融实验表明,部分监督的显著性,以及我们优异的性能。

关键词

引用

@article{arxiv.2502.12917,
  title  = {Contrast-Unity for Partially-Supervised Temporal Sentence Grounding},
  author = {Haicheng Wang and Chen Ju and Weixiong Lin and Chaofan Ma and Shuai Xiao and Ya Zhang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2502.12917},
  year   = {2025}
}

备注

Accepted by ICASSP 2025.The first two authors share the same contribution. arXiv admin note: text overlap with arXiv:2302.09850