中文

Mocap-2-to-3:基于 2D 预训练的单目运动恢复多视角提升

计算机视觉与模式识别 2026-03-16 v6

摘要

现实世界交互的人体运动恢复需求既要精确的动作细节,也要度量尺度的轨迹。从单目输入恢复绝对人体姿态是可行方案,但面临两个主要挑战:(1)模型对受限环境中 3D 训练数据的依赖限制了其在更外部分布数据的泛化能力;(2)从单目观测量估计度量尺度姿态的固有难度。本文引入 Mocap-2-to-3,一种与先前 HMR 方法不同的新框架,通过从单目输入恢复绝对姿态并利用丰富的 2D 数据来增强 3D 运动恢复。为有效利用大规模 2D 数据中的动作先验和多样性,我们将 3D 运动重新表述为多视角合成过程,并将训练分为两个阶段:首先在大量 2D 数据上预训练单视图扩散模型,然后在 3D 数据上进行多视角微调,以实现强先验与几何约束的结合。此外,为恢复绝对姿态,我们引入一种新颖的人体运动表示方法,将局部姿态学习与全局运动学习解耦,同时编码地面几何先验以加速收敛,从而在物理世界中获得更精确的定位。在野外基准测试中,我们的方法在相机空间运动真实性和世界坐标系人体定位方面均优于最先进的方法,同时展现出强大的泛化能力。

关键词

引用

@article{arxiv.2503.03222,
  title  = {Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining},
  author = {Zhumei Wang and Zechen Hu and Ruoxi Guo and Huaijin Pi and Ziyong Feng and Liang Zhang and Mingtao Pei and Siyuan Huang},
  journal= {arXiv preprint arXiv:2503.03222},
  year   = {2026}
}

备注

Project page: https://wangzhumei.github.io/mocap-2-to-3/