面向半监督时间语言定位的自监督学习
计算机视觉与模式识别
2021-12-07 v2
摘要
给定文本描述,时间语言定位(TLG)旨在未裁剪视频中定位包含指定语义的片段的时间边界。TLG 本质上是一项具有挑战性的任务,因为它需要全面理解句子语义与视频内容。以往工作要么在需要大量时间标注的全监督设定下处理该任务,要么在通常无法取得满意性能的弱监督设定下处理。由于人工标注代价高昂,为应对有限标注,我们以半监督方式结合自监督学习来处理 TLG,并提出自监督半监督时间语言定位(S^4TLG)。S^4TLG 包含两部分:(1)伪标签生成模块,基于教师模型的预测为无标签样本自适应生成即时伪标签;(2)具有模态间与模态内对比损失的自监督特征学习模块,在视频内容一致性与视频-文本对齐约束下学习视频特征表示。我们在 ActivityNet-CD-OOD 与 Charades-CD-OOD 数据集上进行了充分实验。结果表明,我们提出的 S^4TLG 仅使用少量时间标注即可取得与全监督最先进(SOTA)方法相竞争的性能。
引用
@article{arxiv.2109.11475,
title = {Self-supervised Learning for Semi-supervised Temporal Language Grounding},
author = {Fan Luo and Shaoxiang Chen and Jingjing Chen and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2109.11475},
year = {2021}
}