中文

文本驱动三维人体运动生成的多轨时间线控制

计算机视觉与模式识别 2024-05-27 v2 图形学 机器学习

摘要

生成建模的最新进展在从文本合成三维人体运动方面取得了有希望的进展,这些方法可以从简短提示和指定时长生成角色动画。然而,使用单个文本提示作为输入缺乏动画师所需的细粒度控制,例如组合多个动作和定义运动部分的精确时长。为了解决这个问题,我们引入了文本驱动运动合成的时间线控制这一新问题,为用户提供了直观且细粒度的输入界面。用户不再使用单个提示,而是可以指定一个多轨时间线,其中包含按时间间隔组织的多个提示,这些间隔可能重叠。这使得可以指定每个动作的精确时间,并按顺序或重叠间隔组合多个动作。为了从多轨时间线生成复合动画,我们提出了一种新的测试时去噪方法。该方法可以集成到任何预训练的运动扩散模型中,以合成准确反映时间线的逼真运动。在去噪的每一步,我们的方法单独处理每个时间线间隔(文本提示),随后聚合预测,同时考虑每个动作所涉及的特定身体部位。实验比较和消融研究验证了我们的方法能够生成尊重给定文本提示的语义和时长的逼真运动。我们的代码和模型可在 https://mathis.petrovich.fr/stmc 公开获取。

关键词

引用

@article{arxiv.2401.08559,
  title  = {Multi-Track Timeline Control for Text-Driven 3D Human Motion Generation},
  author = {Mathis Petrovich and Or Litany and Umar Iqbal and Michael J. Black and Gül Varol and Xue Bin Peng and Davis Rempe},
  journal= {arXiv preprint arXiv:2401.08559},
  year   = {2024}
}

备注

CVPR 2024, HuMoGen Workshop