中文

通过跨模态流形对齐从单目视频学习人体运动

计算机视觉与模式识别 2024-04-16 v1 图形学

摘要

从 2D 输入学习 3D 人体运动是计算机视觉和计算机图形学领域的一项基础任务。许多先前的方法通过在学习过程中引入运动先验来处理这一固有的模糊任务。然而,这些方法在定义此类先验的完整配置或训练稳健模型方面面临困难。在本文中,我们提出了视频到运动生成器 (VTM),它通过 3D 人体运动与 2D 输入(即视频和 2D 关键点)之间的跨模态潜在特征空间对齐来利用运动先验。为了降低运动先验建模的复杂性,我们分别对上半身和下半身部分的运动数据进行建模。此外,我们将运动数据与尺度不变的虚拟骨架对齐,以减轻人体骨架变化对运动先验的干扰。在 AIST++ 上评估,VTM 在从单目视频重建 3D 人体运动方面展现了 SOTA 性能。值得注意的是,我们的 VTM 展现出了泛化至未见视角和野外视频的能力。

关键词

引用

@article{arxiv.2404.09499,
  title  = {Learning Human Motion from Monocular Videos via Cross-Modal Manifold Alignment},
  author = {Shuaiying Hou and Hongyu Tao and Junheng Fang and Changqing Zou and Hujun Bao and Weiwei Xu},
  journal= {arXiv preprint arXiv:2404.09499},
  year   = {2024}
}