运动的语言:统一语义和非语义的人类运动
计算机视觉与模式识别
2024-12-17 v1
摘要
人类沟通本质上是多模态的,涉及语音、面部表情和身体姿势等非语义线索的组合。对这些行为进行建模对于理解人类交互以及创建在游戏、电影和虚拟现实等应用中能够自然交流的虚拟角色至关重要。然而,现有的运动生成模型通常仅限于特定输入模态——即语音、文本或运动数据,无法充分利用可用数据的多样性。本文提出了一种新颖的框架,通过多模态语言模型统一语义和非语义的人类运动,以实现人类运动的理解与生成。该模型可以灵活地以文本、语音或运动数据,或其任意组合形式作为输入。配合我们新颖的预训练策略,该模型不仅在协语气肢体生成方面实现了最先进的性能,还需要的训练数据显著减少。我们的模型还解锁了一系列新任务,如可编辑的肢体生成和从运动中预测情绪。我们认为,统一人类运动的语义和非语义语言对于现实应用至关重要,语言模型提供了实现这一目标的强大方法。项目页面:languageofmotion.github.io。
引用
@article{arxiv.2412.10523,
title = {The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion},
author = {Changan Chen and Juze Zhang and Shrinidhi K. Lakshmikanth and Yusu Fang and Ruizhi Shao and Gordon Wetzstein and Li Fei-Fei and Ehsan Adeli},
journal= {arXiv preprint arXiv:2412.10523},
year = {2024}
}
备注
Project page: languageofmotion.github.io