VideoMoCo:基于时间对抗样本的对比视频表示学习
计算机视觉与模式识别
2021-03-18 v2 机器学习
多媒体
摘要
MoCo对无监督图像表示学习十分有效。本文提出VideoMoCo用于无监督视频表示学习。给定视频序列作为输入样本,我们从两个角度改进MoCo的时间特征表示。首先,引入生成器在该样本时间上丢弃若干帧,随后判别器被学习为无论帧移除均编码相似特征表示。通过在对抗学习训练迭代中自适应丢弃不同帧,我们将该输入样本增广为训练时间鲁棒编码器。其次,在计算对比损失时使用时间衰减建模记忆队列中的键衰减。由于动量编码器在键入队后更新,当使用当前输入样本进行对比学习时这些键的表示能力退化。该退化通过时间衰减反映,使输入样本关注队列中近期键。据此,我们使MoCo无需经验设计前置任务即可学习视频表示。通过增强编码器的时间鲁棒性并建模键的时间衰减,我们的VideoMoCo在时间上基于对比学习改进了MoCo。在UCF101与HMDB51等基准数据集上的实验表明VideoMoCo是一种最优的视频表示学习方法。
引用
@article{arxiv.2103.05905,
title = {VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples},
author = {Tian Pan and Yibing Song and Tianyu Yang and Wenhao Jiang and Wei Liu},
journal= {arXiv preprint arXiv:2103.05905},
year = {2021}
}
备注
CVPR 2021