中文

Kimodo:可扩展可控人类运动生成

计算机视觉与模式识别 2026-03-17 v1 图形学 机器人学

摘要

高质量的人类运动数据正在变得越来越重要,适用于机器人、仿真和娱乐等应用。最近的生成模型提供了潜在的数据来源,使通过直观输入(如文本提示或对姿态的运动约束)实现人类运动合成成为可能。然而,公共动捕数据集的规模较小,限制了这些模型的运动质量、控制精度和泛化能力。在本工作中,我们引入了 Kimodo,这是一个在 700 小时光学动捕数据上训练的表达且可控的运动扩散模型。我们的模型在保持高质量运动的同时,通过文本和包括全身关键帧、稀疏关节位置/旋转、2D 路点和密集 2D 路径等综合套件的运动约束实现易于控制。这通过精心设计的运动表示和两阶段去噪器架构实现,该架构将根和身体预测分解,以最小化运动瑕疵并允许灵活的约束条件。在大型动捕数据集上的实验证明了关键设计决策,并分析了数据规模和模型规模对性能的影响。

关键词

引用

@article{arxiv.2603.15546,
  title  = {Kimodo: Scaling Controllable Human Motion Generation},
  author = {Davis Rempe and Mathis Petrovich and Ye Yuan and Haotian Zhang and Xue Bin Peng and Yifeng Jiang and Tingwu Wang and Umar Iqbal and David Minor and Michael de Ruyter and Jiefeng Li and Chen Tessler and Edy Lim and Eugene Jeong and Sam Wu and Ehsan Hassani and Michael Huang and Jin-Bey Yu and Chaeyeon Chung and Lina Song and Olivier Dionne and Jan Kautz and Simon Yuen and Sanja Fidler},
  journal= {arXiv preprint arXiv:2603.15546},
  year   = {2026}
}

备注

Project page: https://research.nvidia.com/labs/sil/projects/kimodo/