MotionCraft:用于插拔式多模态控制的全身运动生成
计算机视觉与模式识别
2024-08-27 v3
摘要
全身多模态运动生成技术已广泛应用于视频生成和角色动画等领域,但如何构建统一模型以适应不同条件模态下的多种生成任务,面临两个主要挑战:一是不同任务(如协 speech 手势和文本驱动的日常动作)间的运动分布漂移;二是粒度不同的混合条件(如文本与音频)的复杂优化。此外,跨任务和数据集的运动格式不一致也阻碍了多模态运动生成的有效训练。本文提出MotionCraft——一种支持插拔式多模态控制的统一扩散转换器,用于全身运动生成。该框架采用粗到细训练策略,首先进行文本到运动的语义预训练,再进行多模态低层次控制适配,以处理不同粒度的条件。为有效学习和跨分布迁移运动知识,我们设计了MC-Attn用于静态和动态人体拓扑图的并行建模。为克服现有基准的运动格式不一致问题,我们引入MC-Bench——基于统一SMPL-X格式的首个多模态全身运动生成基准。大量实验表明,MotionCraft在各种标准运动生成任务上实现了最先进的性能。
引用
@article{arxiv.2407.21136,
title = {MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls},
author = {Yuxuan Bian and Ailing Zeng and Xuan Ju and Xian Liu and Zhaoyang Zhang and Wei Liu and Qiang Xu},
journal= {arXiv preprint arXiv:2407.21136},
year = {2024}
}