中文

FreeMotion:基于多模态大语言模型的无动捕捉人体动作合成

计算机视觉与模式识别 2024-11-12 v3

摘要

人体动作合成是计算机动画中的基础任务。尽管近期通过深度学习和动作捕捉数据取得进展,但现有方法始终局限于特定动作类别、环境和风格。这种差异化不足可部分归因于收集大规模高质量动作数据的困难与成本。与此同时,基于 internet 规模图像和文本数据训练的基础模型展现出惊人的世界知识与推理能力,已在各种下游任务中取得突出成绩。利用这些基础模型有助于人体动作合成——近期研究仅做了浅尝辄止。然而,这些方法未充分释放基础模型潜力,仅支持几种简单动作和环境。本文首次在无动作数据情况下,基于 MLLMs 以自然语言指令作为用户控制信号,探索开放集合人体动作合成,适用于任何动作任务和环境。我们的框架分为两个阶段:1)利用 MLLMs 作为关键帧设计师和动画师进行顺序关键帧生成;2)通过插值和动作跟踪实现关键帧间的动作填充。我们的方法可实现多数下游任务的通用人体动作合成。鼎舞的结果表明,受 MLLMs 辅助的无动捕捉人体动作合成具有潜力,为未来研究指明了方向。

关键词

引用

@article{arxiv.2406.10740,
  title  = {FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models},
  author = {Zhikai Zhang and Yitang Li and Haofeng Huang and Mingxian Lin and Li Yi},
  journal= {arXiv preprint arXiv:2406.10740},
  year   = {2024}
}