LocVTP:面向时序定位的视频-文本预训练
计算机视觉与模式识别
2022-07-22 v1
摘要
视频-文本预训练(VTP)旨在从大规模网络视频中学习可迁移的表征,以用于各种下游任务。迄今为止,几乎所有现有的 VTP 方法都局限于基于检索的下游任务(如视频检索),而它们在基于定位的任务(如时序定位)上的迁移潜力尚未得到充分探索。本文通过实验分析并证明了当前 VTP 方法与定位任务的不兼容性,提出了一种新颖的面向定位的视频-文本预训练框架,称为 LocVTP。具体而言,我们通过片段-词对应发现机制,将细粒度对比对齐作为粗粒度对比对齐的补充。为了进一步增强所学特征的时序推理能力,我们提出了上下文投影头与时序感知对比损失,以感知上下文关系。在六个数据集上的四个下游任务中进行的广泛实验表明,我们的 LocVTP 在基于检索和基于定位的任务上均达到了最先进的性能。此外,我们进行了全面的消融研究与深入分析,以探索最优的模型设计与训练策略。
引用
@article{arxiv.2207.10362,
title = {LocVTP: Video-Text Pre-training for Temporal Localization},
author = {Meng Cao and Tianyu Yang and Junwu Weng and Can Zhang and Jue Wang and Yuexian Zou},
journal= {arXiv preprint arXiv:2207.10362},
year = {2022}
}
备注
Accepted by ECCV2022