中文

VersatileMotion:用于运动合成与理解的统一框架

计算机视觉与模式识别 2025-05-27 v2

摘要

大语言模型(LLMs)本质上具备多任务学习能力:通过统一的下一个标记预测范式,它们可以自然地解决广泛的下游任务。运动领域的先前工作已通过适配LLMs的Motion Tokenizer配合自回归Transformer来生成和理解人类运动,从而展现出一定的通用性,但这种通用性范围有限且仅带来有限的性能提升。我们引入VersatileMotion,一种统一的多模态运动LLM,结合一种新颖的运动tokenizer,将VQ-VAE与流匹配集成,并采用自回归Transformer作为底层架构,以无缝支持至少九种不同的运动相关任务。VersatileMotion是首个在单一框架中处理单智能体和多智能体运动,并实现运动、文本、音乐和语音之间的跨模态转换的方法,在这些任务中取得了最先进的性能。MotionHub 中的每个序列可能包含一个或多个以下注释:自然语言描述、音乐或音频片段、语音转录文本以及多智能体互动数据。为便于评估,我们定义并发布了覆盖九个核心任务的基准划分。广泛的实验表明,VersatileMotion 在性能、通用性和潜力方面均优于现有方法,作为面向未来运动理解和生成的基础模型具有重要意义。

关键词

引用

@article{arxiv.2411.17335,
  title  = {VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension},
  author = {Zeyu Ling and Bo Han and Shiyang Li and Jikang Cheng and Hongdeng Shen and Changqing Zou},
  journal= {arXiv preprint arXiv:2411.17335},
  year   = {2025}
}