具有风格控制的个性化语音驱动表情化3D面部动画合成
人工智能
2023-10-27 v1 图形学
摘要
不同人在进行情感性说话时具有不同的面部表情。一个逼真的面部动画系统应当考虑此类身份特定的说话风格与面部特征,以实现高度的自然性与可信度。现有的个性化语音驱动3D面部动画方法要么使用独热身份标签,要么依赖于特定人物的模型,这限制了其可扩展性。我们提出了一种个性化语音驱动表情化3D面部动画合成框架,该框架将身份特定的面部运动建模为潜在表示(称为风格),并在给定语音输入及目标风格的条件下,为多种情感类别合成新颖动画。我们的框架以端到端方式训练,具有非自回归编码器-解码器架构,包含三个主要组件:表情编码器、语音编码器和表情解码器。由于表情化面部运动同时包含身份特定风格与语音相关内容信息,表情编码器首先将面部运动序列分别解耦为风格与内容表示。随后,语音编码器与表情解码器均将提取的风格信息作为输入,在训练阶段更新 transformer 层权重。我们的语音编码器还提取语音音素标签与时长信息,以在非自回归合成机制中更有效地实现更好的同步。通过详尽的实验,我们证明了我们的方法能够从输入语音生成时间上连贯的面部表情,同时保留目标身份的说话风格。
引用
@article{arxiv.2310.17011,
title = {Personalized Speech-driven Expressive 3D Facial Animation Synthesis with Style Control},
author = {Elif Bozkurt},
journal= {arXiv preprint arXiv:2310.17011},
year = {2023}
}
备注
8 pages