中文

规划、姿态与行进:面向开放世界的文本至动作生成

计算机视觉与模式识别 2023-12-25 v1

摘要

传统的文本至动作生成方法通常在有限的文本-动作对上训练,使其难以泛化到开放世界场景。一些工作使用 CLIP 模型对齐动作空间与文本空间,旨在实现从自然语言动作描述中生成动作。然而,它们仍受限于生成有限且不切实际的原地动作。为解决这些问题,我们提出了一个名为 PRO-Motion 的分治框架,由动作规划器、姿态扩散器和行进扩散器三个模块组成。动作规划器指示大型语言模型(LLM)生成一系列描述目标动作中关键姿态的脚本。与自然语言不同,这些脚本可以遵循极简单的文本模板描述所有可能的姿态。这显著降低了姿态扩散器的复杂度,该模块将脚本转化为姿态,为开放世界生成铺平了道路。最后,作为另一个扩散模型实现的行进扩散器估计所有姿态的全身平移与旋转,从而生成逼真的动作。实验结果表明了我们的方法相对于其他对比方法的优越性,并证明了其从复杂开放世界提示(如“体验到深刻的喜悦感”)生成多样且逼真动作的能力。项目页面可在 https://moonsliu.github.io/Pro-Motion 获取。

关键词

引用

@article{arxiv.2312.14828,
  title  = {Plan, Posture and Go: Towards Open-World Text-to-Motion Generation},
  author = {Jinpeng Liu and Wenxun Dai and Chunyu Wang and Yiji Cheng and Yansong Tang and Xin Tong},
  journal= {arXiv preprint arXiv:2312.14828},
  year   = {2023}
}