中文

X-MoGen:跨人类和动物统一运动生成

计算机视觉与模式识别 2025-11-18 v2

摘要

文本驱动的运动生成因其在虚拟现实、动画和机器人等广泛应用而受到日益关注。虽然现有方法通常分别建模人类和动物运动,但联合的跨种策略提供了关键优势,如统一的表示和 improved generalization。然而,跨种的形态差异仍是关键挑战,常常损害运动的可信度。为此,我们提出 X-MoGen,即首个覆盖人类和动物的跨种文本驱动运动生成框架。X-MoGen 采用两阶段体系结构。首先,条件图变分自编码器学习标准 T 姿势先验;而自编码器将运动编码到共享潜在空间,并受形态一致性损失正则化。在第二阶段,我们对运动嵌入进行掩码运动建模,以生成以文本描述为条件的运动。训练时,采用形态一致性模块来促进跨种的骨骼可信度。为支持统一建模,我们构建了 UniMo4D,一个包含 115 个种类和 119k 条运动序列的大型数据集,将人类和动物运动整合到共享骨骼拓扑结构下进行联合训练。在 UniMo4D 上的大量实验表明,X-MoGen 在见到的和未见到的种类上均优于最先进的方法。

关键词

引用

@article{arxiv.2508.05162,
  title  = {X-MoGen: Unified Motion Generation across Humans and Animals},
  author = {Xuan Wang and Kai Ruan and Liyang Qian and Zhizhi Guo and Chang Su and Gaoang Wang},
  journal= {arXiv preprint arXiv:2508.05162},
  year   = {2025}
}