用于改进性能驱动说话人脸的模态丢弃方法
音频与语音处理
2020-05-29 v1 机器学习
声音
机器学习
摘要
我们描述了一种利用声学和视觉信息驱动动画人脸的新型深度学习方法。具体而言,与语音相关的面部运动使用视听信息生成,非语音面部运动仅使用视觉信息生成。为确保模型在训练期间利用两种模态,我们生成包含仅音频、仅视频和视听输入特征的批次。丢弃某一模态的概率可控制模型在训练中对音频和视觉信息的利用程度。我们训练好的模型在资源受限硬件(例如智能手机)上实时运行,与用户无关,且不依赖于可能易出错的语音转写。我们通过主观测试证明:1) 视听驱动动画相对于等效仅视频方法的改进;2) 引入模态丢弃后语音相关面部运动动画的改进。在引入丢弃前,测试序列中51%的观众偏好视听驱动动画,而仅视频仅为18%。引入丢弃后,观众对视听驱动动画的偏好增至74%,而仅视频降至8%。
引用
@article{arxiv.2005.13616,
title = {Modality Dropout for Improved Performance-driven Talking Faces},
author = {Ahmed Hussen Abdelaziz and Barry-John Theobald and Paul Dixon and Reinhard Knothe and Nicholas Apostoloff and Sachin Kajareker},
journal= {arXiv preprint arXiv:2005.13616},
year = {2020}
}
备注
Pre-print