DuoMo:面向世界坐标的人类运动扩散重建
计算机视觉与模式识别
2026-03-04 v1
摘要
我们提出了 DuoMo,一种从无约束视频中(带有噪声或不完整观测)恢复人类世界坐标运动的生成方法。要实现此目标,需解决一个根本性权衡:从多样化且噪声较大的视频输入中泛化,同时保持全局运动一致性。我们的做法通过分解运动学习为两个扩散模型来解决此问题。相机空间模型首先从相机坐标中的视频估计运动。世界空间模型随后将此初始估计提升到世界坐标,并对其进行细化以实现全局一致性。两个模型共同工作,可在多样化场景和轨迹下重建运动,即便来源是高度噪声或不完整的观测。此外,我们的方法具有普适性,直接生成网格顶点的运动,绕过参数化模型。DuoMo 实现了最先进的性能。在 EMDB 数据集上,我们的方法可实现世界空间重建误差降低 16%,同时保持低脚部滑行。在 RICH 数据集上,误差降低 30%。项目页面:https://yufu-wang.github.io/duomo/
引用
@article{arxiv.2603.03265,
title = {DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction},
author = {Yufu Wang and Evonne Ng and Soyong Shin and Rawal Khirodkar and Yuan Dong and Zhaoen Su and Jinhyung Park and Kris Kitani and Alexander Richard and Fabian Prada and Michael Zollhofer},
journal= {arXiv preprint arXiv:2603.03265},
year = {2026}
}
备注
CVPR 2026. Project page: https://yufu-wang.github.io/duomo/