中文

DiffSpeaker:基于扩散Transformer的语音驱动3D面部动画

计算机视觉与模式识别 2024-02-09 v1 人工智能

摘要

语音驱动的3D面部动画对于许多多媒体应用至关重要。近期研究在利用扩散模型或Transformer架构处理此任务方面显示出潜力。然而,它们的简单聚合并未带来性能提升。我们怀疑这是由于缺乏配对的音频-4D数据,而这对Transformer在扩散框架内有效充当去噪器至关重要。为了解决这个问题,我们提出了DiffSpeaker,一个配备新颖有偏条件注意力模块的基于Transformer的网络。这些模块替代了标准Transformer中的传统自注意力/交叉注意力,融入了精心设计的偏置,引导注意力机制聚焦于相关的任务特定条件和扩散相关条件。我们还探讨了在扩散范式内精确唇形同步与非言语面部表情之间的权衡。实验表明,我们的模型不仅在现有基准上实现了最先进的性能,而且由于能够并行生成面部运动,推理速度也很快。

关键词

引用

@article{arxiv.2402.05712,
  title  = {DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer},
  author = {Zhiyuan Ma and Xiangyu Zhu and Guojun Qi and Chen Qian and Zhaoxiang Zhang and Zhen Lei},
  journal= {arXiv preprint arXiv:2402.05712},
  year   = {2024}
}

备注

9 pages, 5 figures. Code is avalable at https://github.com/theEricMa/DiffSpeaker