视频长期运动动态的无监督学习
计算机视觉与模式识别
2017-04-13 v3
摘要
我们提出一种无监督表示学习方法,能够紧凑地编码视频中的运动依赖关系。给定视频片段中的一对图像,我们的框架学习预测长期三维运动。为降低学习框架的复杂度,我们提出将运动描述为利用 RGB-D 模态计算得到的原子三维流序列。我们使用基于循环神经网络的编码器-解码器框架来预测这些流序列。我们认为,为了使解码器能够重建这些序列,编码器必须学习一种鲁棒的视频表示,以捕获长期运动依赖关系和时空关联。我们在 NTU RGB+D 和 MSR Daily Activity 3D 等多个模态和数据集上,通过活动分类任务证明了所学时间表示的有效性。我们的框架适用于任何输入模态,即 RGB、深度和 RGB-D 视频。
引用
@article{arxiv.1701.01821,
title = {Unsupervised Learning of Long-Term Motion Dynamics for Videos},
author = {Zelun Luo and Boya Peng and De-An Huang and Alexandre Alahi and Li Fei-Fei},
journal= {arXiv preprint arXiv:1701.01821},
year = {2017}
}
备注
CVPR 2017