Imitator:个性化语音驱动的 3D 面部动画
计算机视觉与模式识别
2023-01-03 v1
摘要
语音驱动的 3D 面部动画已被广泛研究,并在游戏、角色动画、虚拟现实和远程呈现系统中有诸多应用。现有最优方法在不考虑目标演员身份特定的说话风格与面部习性情况下,使目标演员的面部拓扑形变以同步输入音频,从而导致不真实且不准确的唇部运动。为此,我们提出 Imitator,一种语音驱动的面部表情合成方法,它从一段简短的输入视频中学习身份特定细节,并生成符合目标演员身份特定说话风格与面部习性的新面部表情。具体而言,我们在一个大型面部表情数据集上训练了一个风格无关的 transformer,将其作为音频驱动面部表情的先验。基于此先验,我们根据一段简短的参考视频优化身份特定的说话风格。为训练该先验,我们引入了一种基于检测双唇辅音的新型损失函数,以确保合理的唇部闭合,从而提升生成表情的真实感。通过详尽的实验与用户研究,我们表明我们的方法能从输入音频生成时间连贯的面部表情,同时保留目标演员的说话风格。
引用
@article{arxiv.2301.00023,
title = {Imitator: Personalized Speech-driven 3D Facial Animation},
author = {Balamurugan Thambiraja and Ikhsanul Habibie and Sadegh Aliakbarian and Darren Cosker and Christian Theobalt and Justus Thies},
journal= {arXiv preprint arXiv:2301.00023},
year = {2023}
}
备注
https://youtu.be/JhXTdjiUCUw