中文

UDE:一种用于人体运动生成的统一驱动引擎

计算机视觉与模式识别 2022-11-30 v1

摘要

生成可控且可编辑的人体运动序列是3D虚拟人生成中的关键挑战。长期以来,人体运动的生成与动画制作一直耗费大量人力,直到近期基于学习的方法被开发并应用。然而,这些方法仍是任务特定或模态特定的。本文中,我们提出“UDE”,首个统一驱动引擎,可从自然语言或音频序列生成人体运动序列(见图~\ref{fig:teaser})。具体而言,UDE由以下关键组件构成:1)基于VQVAE的运动量化模块,将连续运动序列表示为离散潜码;2)模态无关Transformer编码器,学习将模态感知的驱动信号映射到联合空间;3)统一令牌Transformer(类GPT)网络,以自回归方式预测量化潜码索引;4)扩散运动解码器,以运动令牌为输入并将其解码为具有高多样性的运动序列。我们在HumanML3D和AIST++基准上评估了我们的方法,实验结果表明我们的方法达到了最先进的性能。项目网站:\url{https://github.com/zixiangzhou916/UDE/}

关键词

引用

@article{arxiv.2211.16016,
  title  = {UDE: A Unified Driving Engine for Human Motion Generation},
  author = {Zixiang Zhou and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2211.16016},
  year   = {2022}
}

备注

14 pages, 10 figures, 6 tables