中文

LocVTP:面向时序定位的视频-文本预训练

计算机视觉与模式识别 2022-07-22 v1

摘要

视频-文本预训练(VTP)旨在从大规模网络视频中学习可迁移的表征,以用于各种下游任务。迄今为止,几乎所有现有的 VTP 方法都局限于基于检索的下游任务(如视频检索),而它们在基于定位的任务(如时序定位)上的迁移潜力尚未得到充分探索。本文通过实验分析并证明了当前 VTP 方法与定位任务的不兼容性,提出了一种新颖的面向定位的视频-文本预训练框架,称为 LocVTP。具体而言,我们通过片段-词对应发现机制,将细粒度对比对齐作为粗粒度对比对齐的补充。为了进一步增强所学特征的时序推理能力,我们提出了上下文投影头与时序感知对比损失,以感知上下文关系。在六个数据集上的四个下游任务中进行的广泛实验表明,我们的 LocVTP 在基于检索和基于定位的任务上均达到了最先进的性能。此外,我们进行了全面的消融研究与深入分析,以探索最优的模型设计与训练策略。

关键词

引用

@article{arxiv.2207.10362,
  title  = {LocVTP: Video-Text Pre-training for Temporal Localization},
  author = {Meng Cao and Tianyu Yang and Junwu Weng and Can Zhang and Jue Wang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2207.10362},
  year   = {2022}
}

备注

Accepted by ECCV2022