保持身份的真实感说话人脸生成
计算机视觉与模式识别
2020-05-27 v1
摘要
语音驱动的面部动画在远程呈现、聊天机器人等多种应用中十分有用。真实感人脸动画应具备的必要属性为:(1) 音视频同步,(2) 目标个体的身份保持,(3) 合理的嘴部运动,(4) 自然眨眼的存在。现有方法大多解决音视频唇部同步问题,少数近期工作针对自然眨眼合成以提升整体视频真实感。本文中,我们提出一种从语音生成保持身份的真实感面部动画的方法。我们首先利用 DeepSpeech 特征从音频生成与人物无关的面部关键点,以对不同嗓音、口音等具有不变性。为增加真实感,我们通过无监督学习在面部关键点上施加眨眼,并将与人物无关的关键点重定向至人物特定关键点,以保留与身份相关的面部结构,这有助于生成目标身份的合理嘴形。最后,我们使用 LSGAN 从人物特定面部关键点生成面部纹理,采用注意力机制以帮助保留与身份相关的纹理。我们所提方法与当前最先进方法的广泛比较表明,在唇同步精度、图像重建质量、清晰度和身份保持方面均有显著提升。用户研究也显示我们的动画结果比最先进方法更具真实感。据我们所知,这是语音驱动二维面部动画中首个同时解决上述所有真实感语音驱动人脸动画属性的工作。
引用
@article{arxiv.2005.12318,
title = {Identity-Preserving Realistic Talking Face Generation},
author = {Sanjana Sinha and Sandika Biswas and Brojeshwar Bhowmick},
journal= {arXiv preprint arXiv:2005.12318},
year = {2020}
}
备注
Accepted in IJCNN 2020