中文

用于无监督表示学习的时间感知与视角感知视频渲染

计算机视觉与模式识别 2018-11-30 v2

摘要

深度学习的近期成功催生了多种有效的视频表示学习方法。然而,当前的视频表示方法需要大量人工标注数据集才能有效学习。我们提出了一种无监督表示学习框架,用于编码从多个视角捕获的视频中的场景动态。所提框架包含两个主要组件:表示学习网络(RL-NET),借助混合网络(BL-NET)学习表示;以及视频渲染网络(VR-NET),用于视频合成。该框架以不同视角和时间的视频片段作为输入,学习内部表示并利用该表示从任意给定视角和时间渲染视频片段。所提网络从任意视角和时间渲染视频帧的能力使其能学习到有意义且鲁棒的场景动态表示。我们在包括 UCF-101 和 NTU-RGB+D 的两个不同真实世界数据集上证明了该方法在渲染视角感知以及时间感知视频片段上的有效性。为了进一步验证所学表示的有效性,我们将其用于视角不变活动分类任务,观察到在 NTU-RGB+D 数据集上性能相较现有最先进方法显著提升(约 26%)。

关键词

引用

@article{arxiv.1811.10699,
  title  = {Time-Aware and View-Aware Video Rendering for Unsupervised Representation Learning},
  author = {Shruti Vyas and Yogesh S Rawat and Mubarak Shah},
  journal= {arXiv preprint arXiv:1811.10699},
  year   = {2018}
}