中文

FaceXHuBERT:基于自监督语音表征学习的无文本语音驱动富有表现力的 3D 面部动画合成

计算机视觉与模式识别 2023-03-10 v1 人工智能

摘要

本文提出 FaceXHuBERT,一种无文本语音驱动的 3D 面部动画生成方法,能够捕捉语音中个性化且细微的线索(例如身份、情感和犹豫)。该方法对背景噪声也非常鲁棒,并能处理多种情形下录制的音频(例如多人说话)。近期的方法采用端到端深度学习,同时考虑音频和文本作为输入来生成整张脸的面部动画。然而,公开可用的富有表现力的音频-3D 面部动画数据集的稀缺性构成了主要瓶颈。由此生成的动画在精准口型同步、表现力、人物特定信息以及泛化性方面仍存在不足。我们在训练过程中有效采用自监督预训练的 HuBERT 模型,使得我们无需使用大型词典即可将音频中的词汇与非词汇信息一并纳入。此外,以二值情感条件和说话人身份引导训练,可区分极细微的面部运动。我们针对真值与最先进工作开展了广泛的客观与主观评估。一项感知用户研究表明,与最先进方法相比,我们的方法在 78% 的情况下能生成更逼真的动画。此外,我们的方法快 4 倍,且省去了 transformer 等复杂序列模型的使用。我们强烈建议在阅读本文前观看补充视频。我们还通过 GitHub 仓库链接提供了实现与评估代码。

关键词

引用

@article{arxiv.2303.05416,
  title  = {FaceXHuBERT: Text-less Speech-driven E(X)pressive 3D Facial Animation Synthesis Using Self-Supervised Speech Representation Learning},
  author = {Kazi Injamamul Haque and Zerrin Yumak},
  journal= {arXiv preprint arXiv:2303.05416},
  year   = {2023}
}

备注

13 pages, 4 figures, code included