Audio2Head:基于音频驱动的单样本说话头生成与自然头部运动
计算机视觉与模式识别
2021-07-21 v1 计算与语言
摘要
我们提出一种音频驱动的说话头方法,从单张参考图像生成照片级真实感说话头视频。本工作中,我们解决两个关键挑战:(i)生成与语音韵律匹配的自然头部运动;(ii)在大幅头部运动下保持说话人外观并稳定非面部区域。我们首先通过用运动感知循环神经网络(RNN)建模刚性6D头部运动来设计头部姿态预测器。如此,预测的头部姿态充当说话头的低频整体运动,从而使我们的后续网络专注于细节面部运动生成。为刻画由音频引起的整幅图像运动,我们利用基于关键点的稠密运动场表示。随后,我们开发运动场生成器,从输入音频、头部姿态和参考图像生成稠密运动场。由于该基于关键点的表示整体建模了面部区域、头部和背景的运动,我们的方法能更好地约束生成视频的空间与时间一致性。最后,采用图像生成网络从估计的基于关键点的运动场和输入参考图像渲染照片级真实感说话头视频。大量实验表明,我们的方法生成的视频具有合理头部运动、同步面部表情和稳定背景,并优于当前最优方法(SOTA)。
引用
@article{arxiv.2107.09293,
title = {Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion},
author = {Suzhen Wang and Lincheng Li and Yu Ding and Changjie Fan and Xin Yu},
journal= {arXiv preprint arXiv:2107.09293},
year = {2021}
}