用于自监督视频表征的运动敏感对比学习
计算机视觉与模式识别
2022-08-15 v1
摘要
对比学习在视频表征学习中已展现出巨大潜力。然而,现有方法未能充分挖掘对各类下游视频理解任务至关重要的短期运动动态。本文提出运动敏感对比学习(Motion Sensitive Contrastive Learning, MSCL),将光流捕获的运动信息注入 RGB 帧以强化特征学习。为此,除片段级全局对比学习外,我们开发了跨两种模态的帧级对比目标局部运动对比学习(Local Motion Contrastive Learning, LMCL)。此外,我们引入流旋转增强(Flow Rotation Augmentation, FRA)生成额外的运动打乱负样本,并提出运动差分采样(Motion Differential Sampling, MDS)以准确筛选训练样本。在标准基准上的大量实验验证了所提方法的有效性。以常用的 3D ResNet-18 为骨干网络,我们在 UCF101 和 Something-Something v2 上分别取得 91.5% 和 50.3% 的视频分类 top-1 准确率,并在 UCF101 视频检索上取得 65.6% 的 top-1 召回率,显著提升了当前最优水平。
引用
@article{arxiv.2208.06105,
title = {Motion Sensitive Contrastive Learning for Self-supervised Video Representation},
author = {Jingcheng Ni and Nan Zhou and Jie Qin and Qian Wu and Junqi Liu and Boxun Li and Di Huang},
journal= {arXiv preprint arXiv:2208.06105},
year = {2022}
}
备注
Accepted by ECCV2022, 17 pages