基于单说话人音视觉关联学习的一次性说话人脸生成
计算机视觉与模式识别
2021-12-07 v1
摘要
音频驱动的一次性说话人脸生成方法通常在多人的视频资源上训练。然而,由于这些方法难以从不同说话人处学习一致的语音风格,其生成的视频常出现不自然的嘴形与不同步的唇部。我们观察到,从特定说话人学习一致的语音风格要容易得多,从而可产生真实的嘴部运动。因此,我们提出一种新颖的一次性说话人脸生成框架,通过探索特定说话人音频与视觉运动之间的一致关联,并将音频驱动的运动场迁移至参考图像。具体而言,我们开发了音视觉关联Transformer(AVCT),旨在从输入音频推断以基于关键点的稠密运动场表示的说话运动。特别地,考虑到部署时音频可能来自不同身份,我们引入音素来表示音频信号。如此,我们的AVCT可天然泛化至其他身份所说的音频。此外,由于使用人脸关键点表示说话人,AVCT对训练说话人的外观无关,从而允许我们便捷地操控不同身份的人脸图像。考虑到不同脸型导致不同运动,我们利用运动场迁移模块来缩小训练身份与一次性参考之间的音频驱动稠密运动场差距。一旦获得参考图像的稠密运动场,我们采用图像渲染器从音频片段生成其说话人脸视频。得益于我们学习到的一致说话风格,我们的方法生成真实的嘴形与生动的运动。大量实验表明,我们的合成视频在视觉质量与唇形同步方面优于最先进水平。
引用
@article{arxiv.2112.02749,
title = {One-shot Talking Face Generation from Single-speaker Audio-Visual Correlation Learning},
author = {Suzhen Wang and Lincheng Li and Yu Ding and Xin Yu},
journal= {arXiv preprint arXiv:2112.02749},
year = {2021}
}
备注
Accepted by AAAI 2022