GenM$^3$: 用于文本条件人类运动生成的生成式预训练多路径运动模型
计算机视觉与模式识别
2025-07-29 v2
摘要
扩大运动数据集规模是提升运动生成能力的关键。然而,在大规模多来源数据集上训练会引入数据异构性挑战,由于运动内容的差异。在此基础上,我们提出生成式预训练多路径运动模型(GenM),一个旨在学习统一运动表示的综合框架。GenM包含两个组件:1) 多专家 VQ-VAE (MEVQ-VAE),适用于不同数据集分布以学习统一的离散运动表示;2) 多路径运动变换器(MMT),通过使用每个模态专用的独立路径来提高局部模态表示,每条路径都密集激活专家以适应该模态内的差异,并通过文本-运动共享路径来提高跨模态对齐。为实现大规模训练,我们整合并统一 11 个高质量运动数据集(约 220 小时运动数据),并通过大语言模型( nearly 10,000 条由大语言模型标记,300+ 条由人类专家标记)增添文本注释。训练完成后,GenM在 HumanML3D 数据集上实现了 0.035 的最新 FID 分数,显著优于现有方法。它还在 IDEA400 数据集上显示出强大的零样本泛化能力,凸显了其在多样化运动情景中的有效性与适应性。
引用
@article{arxiv.2503.14919,
title = {GenM$^3$: Generative Pretrained Multi-path Motion Model for Text Conditional Human Motion Generation},
author = {Junyu Shi and Lijiang Liu and Yong Sun and Zhiyuan Zhang and Jinni Zhou and Qiang Nie},
journal= {arXiv preprint arXiv:2503.14919},
year = {2025}
}