中文

D3G:基于高斯先验与扫视标注的时间句定位探索

计算机视觉与模式识别 2023-08-09 v1

摘要

时间句定位(TSG)旨在根据给定的自然语言查询从未剪辑视频中定位特定片段。近来,弱监督方法相较于全监督方法仍存在较大性能差距,而后者需要耗费人力的时刻标注。在本研究中,我们旨在降低标注成本,同时使 TSG 任务相比全监督方法保持有竞争力的性能。为实现该目标,我们考察了近期提出的扫视监督时间句定位任务,该任务对每个查询仅需单帧标注(称为扫视标注)。在此设定下,我们提出了一种基于动态高斯先验与扫视标注的定位框架(D3G),其由语义对齐组对比学习模块(SA-GCL)和动态高斯先验调整模块(DGA)组成。具体而言,SA-GCL 通过联合利用高斯先验与语义一致性从二维时间图中采样可靠的正片段,有助于在联合嵌入空间中对齐正句子-片段对。此外,为缓解扫视标注带来的标注偏差并建模由多事件构成的复杂查询,我们提出 DGA 模块,其动态调整分布以逼近目标片段的真实值。在三个具挑战性基准上的大量实验验证了所提 D3G 的有效性。它以较大优势超越最先进的弱监督方法,并缩小了与全监督方法的性能差距。代码见 https://github.com/solicucu/D3G。

关键词

引用

@article{arxiv.2308.04197,
  title  = {D3G: Exploring Gaussian Prior for Temporal Sentence Grounding with Glance Annotation},
  author = {Hanjun Li and Xiujun Shu and Sunan He and Ruizhi Qiao and Wei Wen and Taian Guo and Bei Gan and Xing Sun},
  journal= {arXiv preprint arXiv:2308.04197},
  year   = {2023}
}

备注

ICCV2023