基于动态逐像素损失的分层跨模态说话人脸生成
计算机视觉与模式识别
2019-05-13 v1
摘要
我们设计了一种级联GAN方法来生成说话人脸视频,该方法对不同脸型、视角、面部特征以及含噪音频条件均具有鲁棒性。与学习从音频到视频帧的直接映射不同,我们提出首先将音频转换为高层结构,即面部标志点,然后以标志点为条件生成视频帧。与直接的音频到图像方法相比,我们的级联方法避免了拟合与语音内容无关的音视频信号之间的虚假相关性。我们人类对视频中的时间不连续性和细微伪影十分敏感。为避免这些像素抖动问题并迫使网络关注音视频相关区域,我们提出了一种带有注意力机制的新颖动态可调逐像素损失。此外,为生成具有良好同步面部运动的更清晰图像,我们提出了一种新颖的基于回归的判别器结构,其同时考虑序列级信息与帧级信息。在多个数据集和真实样本上的细致实验表明,在定量与定性比较中,我们的方法所得结果均显著优于最先进的(SOTA)方法。
引用
@article{arxiv.1905.03820,
title = {Hierarchical Cross-Modal Talking Face Generationwith Dynamic Pixel-Wise Loss},
author = {Lele Chen and Ross K. Maddox and Zhiyao Duan and Chenliang Xu},
journal= {arXiv preprint arXiv:1905.03820},
year = {2019}
}