面向自监督时空表征学习的视频播放速率感知
计算机视觉与模式识别
2020-06-23 v1
摘要
在自监督时空表征学习中,时间分辨率与长短时特征尚未被充分探索,这限制了所学模型的表征能力。本文提出一种新颖的自监督方法,称为视频播放速率感知(PRP),以简单而有效的方式学习时空表征。PRP 根植于一种膨胀采样策略,该策略为表征模型学习生成关于视频播放速率的自监督信号。PRP 由特征编码器、分类模块与重建解码器实现,以协同判别-生成的方式实现时空语义保持。判别感知模型跟随特征编码器,通过分类快进速率偏好感知低时间分辨率与长时表征。生成感知模型作为特征解码器,通过引入运动注意力机制聚焦于理解高时间分辨率与短时表征。PRP 应用于典型视频目标任务,包括动作识别与视频检索。实验表明,PRP 以显著优势优于最先进的自监督模型。代码见 github.com/yuanyao366/PRP
引用
@article{arxiv.2006.11476,
title = {Video Playback Rate Perception for Self-supervisedSpatio-Temporal Representation Learning},
author = {Yuan Yao and Chang Liu and Dezhao Luo and Yu Zhou and Qixiang Ye},
journal= {arXiv preprint arXiv:2006.11476},
year = {2020}
}
备注
CVPR 2020