中文

T3M: 基于文本引导的 3D 人体运动合成

计算机视觉与模式识别 2024-09-27 v1

摘要

语音驱动的 3D 人体运动合成旨在基于人类语音创建逼真的动画,具有在虚拟现实、游戏和电影制作等领域的潜在应用价值。现有方法仅依赖语音音频进行运动生成,导致合成结果不够准确且缺乏灵活性。为缓解此问题,本文引入一种新颖的文本引导的 3D 人体运动合成方法,称为 T3M。与传统方法不同,T3M 允许通过文本输入实现对运动合成的精确控制,从而增强结果的多样性和用户自定义程度。实验结果表明,T3M 在定性和定量评估方面均显著优于当前最先进的方法。我们已公开发布代码,链接为 https://github.com/Gloria2tt/T3M.git

关键词

引用

@article{arxiv.2408.12885,
  title  = {T3M: Text Guided 3D Human Motion Synthesis from Speech},
  author = {Wenshuo Peng and Kaipeng Zhang and Sai Qian Zhang},
  journal= {arXiv preprint arXiv:2408.12885},
  year   = {2024}
}

备注

10 pages,4figures