PreViTS:基于视频跟踪监督的对比预训练
计算机视觉与模式识别
2022-09-30 v2
摘要
由于物体自然时间变换的存在,视频是视觉表征自监督学习(SSL)的丰富来源。然而,当前方法通常随机采样视频片段进行学习,这导致不完美的监督信号。在这项工作中,我们提出 PreViTS,一个利用无监督跟踪信号来选择包含同一物体的片段的 SSL 框架,这有助于更好地利用物体的时间变换。PreViTS 进一步利用跟踪信号在空间上约束要学习的帧区域,并通过在 Grad-CAM 注意力图上提供监督来训练模型定位有意义的物体。为评估我们的方法,我们在 VGG-Sound 和 Kinetics-400 数据集上使用 PreViTS 训练了一个动量对比(MoCo)编码器。使用 PreViTS 训练在视频下游任务上优于仅通过对比策略学习的表征,在动作分类上取得了最先进的性能。正如在具有背景变化的数据集上的实验所见,PreViTS 有助于学习对背景和上下文变化更鲁棒的特征表征。利用大规模视频通过 PreViTS 学习可以带来更准确和鲁棒的视觉特征表征。
引用
@article{arxiv.2112.00804,
title = {PreViTS: Contrastive Pretraining with Video Tracking Supervision},
author = {Brian Chen and Ramprasaath R. Selvaraju and Shih-Fu Chang and Juan Carlos Niebles and Nikhil Naik},
journal= {arXiv preprint arXiv:2112.00804},
year = {2022}
}
备注
To be presented at WACV 2023