基于密集预测编码的视频表示学习
计算机视觉与模式识别
2019-09-30 v3
摘要
本文的目标是自监督地学习视频中的时空嵌入,以适用于人类动作识别。我们做出三点贡献:第一,我们引入密集预测编码(Dense Predictive Coding, DPC)框架,用于视频上的自监督表示学习。该方法通过循环预测未来表示来学习时空块的密集编码;第二,我们提出一种课程训练方案,以在 progressively 更少时间上下文的情况下预测更远的未来。这鼓励模型仅编码缓慢变化的时空信号,从而得到语义表示;第三,我们通过在 Kinetics-400 数据集上以自监督学习训练 DPC 模型,然后在下游任务(即动作识别)上微调该表示来评估该方法。在单流(仅 RGB)下,DPC 预训练表示在 UCF101(75.7% top1 准确率)和 HMDB51(35.7% top1 准确率)上均达到最先进的自监督性能,显著优于所有先前学习方法,并接近在 ImageNet 上预训练的基线性能。
引用
@article{arxiv.1909.04656,
title = {Video Representation Learning by Dense Predictive Coding},
author = {Tengda Han and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:1909.04656},
year = {2019}
}