中文

LARNet:用于人体动作合成的潜动作表示

计算机视觉与模式识别 2021-10-28 v2

摘要

我们提出 LARNet,一种用于生成人体动作视频的新颖端到端方法。对外观和动态进行联合生成建模以合成视频非常具有挑战性,因此近期的视频合成工作提议将这两个因素分解。然而,这些方法需要驱动视频来建模视频动态。在本工作中,我们转而提出一种生成式方法,其显式地在潜空间学习动作动态,从而在推理时避免了对驱动视频的需求。生成的动作动态使用循环层次结构与时域外观相整合,该结构在不同尺度上诱导运动以聚焦于粗粒度以及细粒度的动作细节。此外,我们提出一种新颖的混合对抗损失函数,旨在改善合成视频的时间连贯性。我们在四个真实世界人体动作数据集上评估了所提出的方法,证明了该方法在生成人体动作方面的有效性。代码见 https://github.com/aayushjr/larnet。

关键词

引用

@article{arxiv.2110.10899,
  title  = {LARNet: Latent Action Representation for Human Action Synthesis},
  author = {Naman Biyani and Aayush J Rana and Shruti Vyas and Yogesh S Rawat},
  journal= {arXiv preprint arXiv:2110.10899},
  year   = {2021}
}

备注

British Machine Vision Conference (BMVC) 2021