中文

FaceTalk: 面向神经参数化头部模型的音频驱动运动扩散

计算机视觉与模式识别 2024-03-19 v2 人工智能 图形学 声音 音频与语音处理

摘要

我们提出FaceTalk,一种新颖的生成方法,旨在从输入音频信号合成高保真度的说话人头部的3D运动序列。为了捕捉人类头部的表现力与细节(包括头发、耳朵和更精细的眼部运动),我们提出将语音信号与神经参数化头部模型的潜在空间耦合,以创建高保真度、时间上连贯的运动序列。我们为此任务提出了一种新的潜在扩散模型,该模型在神经参数化头部模型的表达空间中运行,以合成音频驱动的逼真头部序列。由于缺乏具有对应NPHM表达与音频的数据集,我们优化了这些对应关系,生成一个时间优化的NPHM表达数据集,这些表达与人们说话的音频-视频记录相匹配。据我们所知,这是首个提出生成方法用于逼真且高质量的体积人类头部运动合成的工作,代表了音频驱动3D动画领域的重大进展。值得注意的是,我们的方法在生成合理运动序列方面表现突出,能够产生与NPHM形状空间耦合的高保真头部动画。我们的实验结果证实了FaceTalk的有效性,始终能生成优越且视觉自然的运动,涵盖多样的面部表情和风格,在感知用户研究评估中比现有方法高出75%。

关键词

引用

@article{arxiv.2312.08459,
  title  = {FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models},
  author = {Shivangi Aneja and Justus Thies and Angela Dai and Matthias Nießner},
  journal= {arXiv preprint arXiv:2312.08459},
  year   = {2024}
}

备注

Paper Video: https://youtu.be/7Jf0kawrA3Q Project Page: https://shivangi-aneja.github.io/projects/facetalk/