面向统一多模态运动生成的大型运动模型
计算机视觉与模式识别
2024-04-02 v1
摘要
人体运动生成是动画和视频制作中的一项基础技术,广泛应用于文本到运动、音乐到舞蹈等各种任务。以往的工作侧重于为每个任务开发专门的模型,缺乏可扩展性。在这项工作中,我们提出了大型运动模型(LMM),这是一个以运动为中心的多模态框架,将主流运动生成任务统一到一个通用模型中。统一的运动模型很有吸引力,因为它可以利用广泛的运动数据实现超越单一任务的广泛泛化。然而,由于不同运动数据和任务的异质性,这也具有挑战性。LMM 从三个原则性方面应对这些挑战:1) 数据:我们将具有不同模态、格式和任务的数据集整合到一个全面且统一的运动生成数据集 MotionVerse 中,该数据集包含 10 个任务、16 个数据集、总共 32 万序列和 1 亿帧。2) 架构:我们设计了一种关节注意力机制 ArtAttention,将身体部位感知建模融入扩散变换器主干中。3) 预训练:我们提出了一种新颖的 LMM 预训练策略,采用可变帧率和掩码形式,以更好地利用多样化训练数据中的知识。大量实验表明,我们的通用 LMM 在各种标准运动生成任务上取得了与最先进专业模型相竞争的性能。值得注意的是,LMM 在众多未见任务上表现出强大的泛化能力和涌现特性。此外,我们的消融研究揭示了关于训练和扩展大型运动模型的有价值见解,为未来研究提供了参考。
引用
@article{arxiv.2404.01284,
title = {Large Motion Model for Unified Multi-Modal Motion Generation},
author = {Mingyuan Zhang and Daisheng Jin and Chenyang Gu and Fangzhou Hong and Zhongang Cai and Jingfang Huang and Chongzhi Zhang and Xinying Guo and Lei Yang and Ying He and Ziwei Liu},
journal= {arXiv preprint arXiv:2404.01284},
year = {2024}
}
备注
Homepage: https://mingyuan-zhang.github.io/projects/LMM.html