中文

人体动作序列的深度视频生成、预测与补全

计算机视觉与模式识别 2018-12-24 v3 机器学习

摘要

当前视频生成的深度学习结果仍很有限,而视频预测仅有少数初步结果,视频补全则无相关显著成果。这是由于这三个问题固有的严重不适定性。本文关注人体动作视频,提出一种通用的两阶段深度框架,可在无约束或任意数量约束下生成人体动作视频,统一处理三个问题:给定无输入帧的视频生成、给定前若干帧的视频预测,以及给定首末帧的视频补全。为使问题可解,第一阶段我们训练一个从随机噪声生成人体姿态序列的深度生成模型;第二阶段训练一个骨架到图像网络,用于根据第一阶段生成的完整人体姿态序列生成人体动作视频。通过引入两阶段策略,我们规避了原始不适定问题,并首次生成出时长更长的优质视频生成/预测/补全结果。我们给出定量与定性评估,表明我们的两阶段方法在视频生成、预测与视频补全上优于 SOTA 方法。我们的视频结果演示可参见 https://iamacewhite.github.io/supp/index.html

关键词

引用

@article{arxiv.1711.08682,
  title  = {Deep Video Generation, Prediction and Completion of Human Action Sequences},
  author = {Haoye Cai and Chunyan Bai and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:1711.08682},
  year   = {2018}
}

备注

Under review for CVPR 2018. Haoye and Chunyan have equal contribution