中文

DiffuseStyleGesture:基于扩散模型的风格化音频驱动共语手势生成

人机交互 2023-05-09 v1 多媒体

摘要

沟通的艺术超越言语,还有手势。自动共语手势生成在计算机动画中备受关注。由于手势的多样性以及将手势的节奏和语义与相应语音匹配的难度,这是一项具有挑战性的任务。为解决这些问题,我们提出 DiffuseStyleGesture,一种基于扩散模型的语音驱动手势生成方法。它基于任意长度的给定语音,生成高质量、与语音匹配、风格化且多样的共语手势。具体而言,我们在手势扩散流程中引入交叉局部注意力和自注意力,以生成与语音更匹配且更逼真的手势。然后我们通过无分类器引导训练模型,通过插值或外推控制手势风格。此外,我们利用不同的初始手势和噪声提升了生成手势的多样性。大量实验表明,我们的方法在语音驱动手势生成上优于近期方法。我们的代码、预训练模型和演示可在 https://github.com/YoungSeng/DiffuseStyleGesture 获取。

关键词

引用

@article{arxiv.2305.04919,
  title  = {DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models},
  author = {Sicheng Yang and Zhiyong Wu and Minglei Li and Zhensong Zhang and Lei Hao and Weihong Bao and Ming Cheng and Long Xiao},
  journal= {arXiv preprint arXiv:2305.04919},
  year   = {2023}
}

备注

11 pages, 9 figures, IJCAI 2023