中文

用于动作视频预测的条件时序变分自编码器

计算机视觉与模式识别 2021-08-13 v1

摘要

基于单张人体图像合成逼真的动作序列,关键在于对动作视频中的运动模式与多样性进行建模。本文提出一种动作条件时序变分自编码器(ACT-VAE),以提高运动预测精度并捕捉动作多样性。ACT-VAE 从单张输入图像预测动作片段的姿势序列。它实现为一种深度生成模型,通过在隐空间上的新颖时序建模,依据动作类别保持时间连贯性。此外,ACT-VAE 是一个通用的动作序列预测框架。当与即插即用的姿势到图像(P2I)网络相连时,ACT-VAE 能够合成图像序列。大量实验证明,我们的方法能够预测准确的姿势并合成逼真的图像序列,超越了当前最优方法。与现有方法相比,ACT-VAE 提升了模型精度并保留了多样性。

关键词

引用

@article{arxiv.2108.05658,
  title  = {Conditional Temporal Variational AutoEncoder for Action Video Prediction},
  author = {Xiaogang Xu and Yi Wang and Liwei Wang and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2108.05658},
  year   = {2021}
}

备注

under submission