中文

学习变分运动先验用于基于视频的运动捕捉

计算机视觉与模式识别 2022-10-31 v2

摘要

从单目视频中进行运动捕捉,对于我们人类在虚拟现实(VR)和增强现实(AR)中自然地体验和交互是基础且至关重要的。然而,由于缺乏有效的运动先验建模,现有方法在处理涉及自遮挡和复杂姿态的挑战性情况时仍然力不从心。在本文中,我们提出了一种新颖的变分运动先验(VMP)学习方法,用于基于视频的运动捕捉,以解决上述问题。我们不是直接建立视频域和运动域之间的对应关系,而是提出学习一个通用的潜在空间,以捕捉所有自然运动的先验分布,这作为后续基于视频的运动捕捉任务的基础。为了提高先验空间的泛化能力,我们提出了一个基于Transformer的变分自编码器,该编码器在基于标记的3D动作捕捉数据上进行了预训练,并采用了一个新颖的风格映射模块来提升生成质量。之后,将一个单独的视频编码器附加到预训练的运动生成器上,以便在特定任务的视频数据集上进行端到端的微调。与现有的运动先验模型相比,我们的VMP模型充当了一个运动校正器,能够有效减少逐帧姿态估计中的时间抖动和失败模式,从而产生时间稳定且视觉逼真的运动捕捉结果。此外,我们基于VMP的框架在序列级别对运动进行建模,可以在前向传播中直接生成运动片段,从而在推理过程中实现实时运动捕捉。在公共数据集和真实视频上的大量实验证明了我们框架的有效性和泛化能力。

关键词

引用

@article{arxiv.2210.15134,
  title  = {Learning Variational Motion Prior for Video-based Motion Capture},
  author = {Xin Chen and Zhuo Su and Lingbo Yang and Pei Cheng and Lan Xu and Bin Fu and Gang Yu},
  journal= {arXiv preprint arXiv:2210.15134},
  year   = {2022}
}

备注

9 pages, 9 figures