FaceFormer:基于 Transformer 的语音驱动 3D 面部动画
计算机视觉与模式识别
2022-03-18 v4 图形学
摘要
语音驱动的 3D 面部动画具有挑战性,原因在于人脸复杂的几何结构以及 3D 视听数据的有限可用性。先前的工作通常聚焦于学习短音频窗口的音素级特征且上下文有限,偶尔导致不准确的唇部运动。为应对该局限,我们提出一种基于 Transformer 的自回归模型 FaceFormer,其编码长期音频上下文并自回归地预测一系列动画化的 3D 人脸网格序列。为应对数据稀缺问题,我们集成了自监督预训练的语音表示。此外,我们设计了两种非常契合该特定任务的偏置注意力机制,包括偏置跨模态多头(MH)注意力和带有周期性位置编码策略的偏置因果 MH 自注意力。前者有效对齐音频-运动模态,而后者提供泛化到更长音频序列的能力。大量实验和感知用户研究表明,我们的方法优于现有的最先进(SOTA)方法。代码将公开。
引用
@article{arxiv.2112.05329,
title = {FaceFormer: Speech-Driven 3D Facial Animation with Transformers},
author = {Yingruo Fan and Zhaojiang Lin and Jun Saito and Wenping Wang and Taku Komura},
journal= {arXiv preprint arXiv:2112.05329},
year = {2022}
}
备注
Accepted to CVPR 2022