TCLR:用于视频表征的时序对比学习
计算机视觉与模式识别
2022-03-31 v4
摘要
对比学习已几乎弥合了图像表征监督与自监督学习之间的差距,并且也已在视频中得到探索。然而,先前关于视频数据对比学习的工作尚未探究显式鼓励特征在时序维度上相异的效果。我们提出了一种新的时序对比学习框架,包含两种新颖的损失,以改进现有的对比自监督视频表征学习方法。局部-局部时序对比损失增加了区分同一视频中非重叠片段的任务,而全局-局部时序对比旨在区分输入片段特征图的时间步,以增加所学特征的时序多样性。我们提出的时序对比学习框架在各种下游视频理解任务(如动作识别、少标签动作分类以及多个视频数据集和骨干网络上的最近邻视频检索)中相较最先进结果取得了显著提升。我们还展示了在视觉相似类别的细粒度动作分类上的显著提升。使用常见的 3D ResNet-18 架构并在 UCF101 上预训练,我们在 UCF101 上取得 82.4%(较此前最佳提升 +5.1%)的 top-1 准确率,在 HMDB51 动作分类上取得 52.9%(提升 +5.4%),在 UCF101 最近邻视频检索上取得 56.2%(提升 +11.7%)的 Top-1 召回率。代码发布于 github.com/DAVEISHAN/TCLR。
引用
@article{arxiv.2101.07974,
title = {TCLR: Temporal Contrastive Learning for Video Representation},
author = {Ishan Dave and Rohit Gupta and Mamshad Nayeem Rizve and Mubarak Shah},
journal= {arXiv preprint arXiv:2101.07974},
year = {2022}
}
备注
Accepted to Computer Vision and Image Understanding (CVIU) Journal