Unimotion: 统一的人类运动合成与理解
计算机视觉与模式识别
2024-10-01 v2
摘要
我们介绍 Unimotion,这是首个能够实现灵活运动控制和帧级运动理解的统一多任务人类运动模型。虽然现有工作通过全局文本条件控制头像运动,或通过细粒度逐帧脚本控制,但均无法一次性实现两者。此外,现有工作也无法输出与生成姿态对应的帧级文本描述。相比之下,Unimotion 允许使用全局文本、局部帧级文本,或两者同时控制,为用户提供更灵活的控制方式。重要的是,Unimotion 是首个设计上即可输出与生成姿态对应的局部文本的模型,使用户能够了解何时发生何种运动,这对于广泛的应用场景至关重要。我们展示 Unimotion 开辟了新的应用场景:1)层次化控制,允许用户以不同细节水平指定运动;2)获取现有运动捕捉数据或 YouTube 视频的运动文本描述;3)实现可编辑性,通过文本生成运动,并通过文本编辑进行运动修改。此外,Unimotion 在 established HumanML3D 数据集上实现了帧级文本到运动任务的状态最佳结果。预训练模型和代码已 disponible于我们的项目页面 https://coral79.github.io/uni-motion/。
引用
@article{arxiv.2409.15904,
title = {Unimotion: Unifying 3D Human Motion Synthesis and Understanding},
author = {Chuqiao Li and Julian Chibane and Yannan He and Naama Pearl and Andreas Geiger and Gerard Pons-moll},
journal= {arXiv preprint arXiv:2409.15904},
year = {2024}
}
备注
Project Page: https://coral79.github.io/uni-motion/