用于视频表示学习的记忆增强密集预测编码
计算机视觉与模式识别
2020-08-04 v1
摘要
本文的目标是视频的自监督学习,特别是针对动作识别的表示。我们做出以下贡献:(i) 我们提出一种新的架构与学习框架——记忆增强密集预测编码(MemDPC)用于该任务。它通过在一组压缩记忆上的预测注意力机制进行训练,使得任何未来状态总可由浓缩表示的凸组合构造,从而能够高效地做出多个假设。(ii) 我们研究了仅从 RGB 帧、从无监督光流或同时从二者进行的视觉-only自监督视频表示学习。(iii) 我们在四个不同的下游任务上全面评估所学表示的质量:动作识别、视频检索、少标注学习以及非意图动作分类。在所有情况下,我们均展现出比其他方法更优或相当的最先进性能,且使用的训练数据量少数个数量级。
引用
@article{arxiv.2008.01065,
title = {Memory-augmented Dense Predictive Coding for Video Representation Learning},
author = {Tengda Han and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:2008.01065},
year = {2020}
}
备注
ECCV2020, Spotlight