通过上下文与运动解耦的自监督视频表示学习
计算机视觉与模式识别
2021-04-05 v1 人工智能
摘要
自监督视频表示学习的一个关键挑战是如何在上下文偏置之外有效捕获运动信息。虽然大多数现有工作通过视频特定的代理任务(例如预测片段顺序、时间箭头和节奏)隐式实现这一点,我们开发了一种通过精心设计的代理任务将运动监督从上下文偏置中显式解耦的方法。具体而言,我们以压缩视频(例如 H.264 格式)中的关键帧和运动向量分别作为上下文和运动的监督源,它们可在 CPU 上以超过 500 fps 的效率提取。然后我们设计两个联合优化的代理任务:上下文匹配任务,在视频片段与关键帧特征之间施加成对对比损失;以及运动预测任务,通过编码器-解码器网络的片段特征用于估计近未来的运动特征。这两个任务使用共享的视频骨干网络和分离的 MLP 头。实验表明,我们的方法较先前工作提升了所学视频表示的质量,在 UCF101 和 HMDB51 的视频检索召回率上分别获得 16.0% 和 11.1% 的绝对增益。此外,我们发现运动预测是视频网络的强正则化项,将其作为辅助任务使用以 7.4%~13.8% 的幅度提升了动作识别的准确率。
引用
@article{arxiv.2104.00862,
title = {Self-supervised Video Representation Learning by Context and Motion Decoupling},
author = {Lianghua Huang and Yu Liu and Bin Wang and Pan Pan and Yinghui Xu and Rong Jin},
journal= {arXiv preprint arXiv:2104.00862},
year = {2021}
}
备注
Accepted by CVPR2021