中文

利用层次变分自编码器解耦视频中的空间与时间信息

计算机视觉与模式识别 2016-12-20 v2 机器学习 机器学习

摘要

视频数据中存在多种形式的特征信息。其中最主要的是在多个视频帧之间基本保持静态的物体身份信息,以及在帧与帧之间持续变化的物体姿态与风格信息。现有模型大多将这两种表示混淆,映射到共享的特征空间中。本文提出一种概率方法,利用无监督视频数据学习物体身份与姿态信息的可分离表示。该方法利用一个深度生成模型,其因子化的先验分布编码了隐藏特征集中时间不变性的属性。学习通过变分推断实现。我们展示了在运动角色数据集和旋转三维物体数据集上学习身份与姿态信息的结果。实验结果证明了该模型在分解其表示方面的成功,并表明该模型在迁移学习任务中取得了更好的性能。

关键词

引用

@article{arxiv.1612.04440,
  title  = {Disentangling Space and Time in Video with Hierarchical Variational Auto-encoders},
  author = {Will Grathwohl and Aaron Wilson},
  journal= {arXiv preprint arXiv:1612.04440},
  year   = {2016}
}

备注

fixed typo in equation 16