中文

MoCapAnything V2:面向任意骨骼的端到端动作捕捉

计算机视觉与模式识别 2026-05-15 v2

摘要

近期从单目视频中捕捉任意骨骼动作的方法遵循一种分解式流程,即由视频到姿态网络预测关节位置,再由解析逆运动学阶段恢复关节旋转。虽然有效,但这种设计存在固有局限,因为关节位置不能完全确定旋转,并会留下诸如骨轴扭转等模糊的自由度,且不可微的逆运动学阶段阻止了系统适应噪声预测或针对最终动画目标进行优化。在这项工作中,我们提出了首个完全端到端的框架,其中视频到姿态和姿态到旋转两个阶段都是可学习的并联合优化。我们观察到,姿态到旋转映射的模糊性源于缺失的坐标系信息:相同的关节位置在不同的静止姿态和局部轴约定下可能对应不同的旋转。为解决此问题,我们引入了来自目标资产的参考姿态-旋转对,它与静止姿态一起,不仅锚定了映射,还定义了底层的旋转坐标系。这种表述将旋转预测转化为一个约束良好的条件问题,并实现了有效学习。此外,我们的模型直接从视频预测关节位置,无需依赖网格中间体,提高了鲁棒性和效率。两个阶段共享一个骨骼感知的全局-局部图引导多头注意力模块,用于关节级局部推理和全局协调。在 Truebones Zoo 和 Objaverse 上的实验表明,我们的方法将旋转误差从约 17 度降低到约 10 度,在未见过的骨骼上降低到 6.54 度,同时推理速度比基于网格的流程快约 20 倍。项目页面:https://animotionlab.github.io/MoCapAnythingV2/

关键词

引用

@article{arxiv.2604.28130,
  title  = {MoCapAnything V2: End-to-End Motion Capture for Arbitrary Skeletons},
  author = {Kehong Gong and Zhengyu Wen and Dao Thien Phong and Mingxi Xu and Weixia He and Qi Wang and Ning Zhang and Zhengyu Li and Guanli Hou and Dongze Lian and Xiaoyu He and Mingyuan Zhang and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2604.28130},
  year   = {2026}
}

备注

Project page: https://animotionlab.github.io/MoCapAnythingV2/