中文

用于时间定位的对比语言-动作预训练

计算机视觉与模式识别 2022-04-27 v1

摘要

长视频理解需要设计能够对活动或语言进行时间定位的方法。此类任务的端到端训练受限于计算设备内存约束以及大规模时间标注的缺失。这些局限可通过在由类别标注监督的时间裁剪视频大数据集上预训练来克服。一旦视频编码器预训练完成,常见做法是在微调时将其冻结。因此,视频编码器无法学习时间边界与未见过类别,导致与下游任务间的域差距。此外,使用时间裁剪视频阻碍了捕捉不同动作类别与视频片段中背景上下文的关系,造成泛化能力有限。为应对这些局限,我们提出一种不冻结视频编码器的新型后预训练方法,其利用语言。我们引入掩码对比学习损失,以字幕形式捕捉活动、背景视频片段与语言间的视觉-语言关系。我们的实验表明,所提方法在时间动作定位、少样本时间动作定位与视频语言定位任务上提升了最先进水平。

关键词

引用

@article{arxiv.2204.12293,
  title  = {Contrastive Language-Action Pre-training for Temporal Localization},
  author = {Mengmeng Xu and Erhan Gundogdu and Maksim Lapin and Bernard Ghanem and Michael Donoser and Loris Bazzani},
  journal= {arXiv preprint arXiv:2204.12293},
  year   = {2022}
}

备注

18 pages, 4 figures