基于视频可变播放速度预测的自监督视觉学习
计算机视觉与模式识别
2021-06-02 v2
摘要
我们提出一种通过预测视频的可变播放速度进行自监督视觉学习的方法。在无语义标签的情况下,基于时间相干性假设,我们利用不同播放速度下视觉外观的变化来学习视频的时空视觉表示。为学习整个视频中的时空视觉变化,我们不仅预测单一播放速度,还生成具有随机起始点、多种播放速度和方向的片段。因此,视觉表示可成功地从视频的元信息(播放速度和方向)中学习到。我们还提出一种新的依赖于层的时间分组归一化方法,可应用于 3D 卷积网络以提升表示学习性能,该方法将时间特征划分为若干组,并使用不同的对应参数对每组进行归一化。我们通过在 UCF-101 和 HMDB-51 上微调至动作识别和视频检索任务来验证方法的有效性。
引用
@article{arxiv.2003.02692,
title = {Self-Supervised Visual Learning by Variable Playback Speeds Prediction of a Video},
author = {Hyeon Cho and Taehoon Kim and Hyung Jin Chang and Wonjun Hwang},
journal= {arXiv preprint arXiv:2003.02692},
year = {2021}
}
备注
Accepted by IEEE Access on May 19, 2021