用于音频到视频生成的多模态自适应归一化
计算机视觉与模式识别
2020-12-15 v1
摘要
语音驱动的面部视频生成因其音频与视频域的多模态特性而一直是一个复杂问题。音频包含诸多潜在特征,如表情、音高、响度、韵律(说话风格);而面部视频在头部运动、眨眼、唇形同步、各面部动作单元的运动以及时间平滑性方面具有高度可变性。从音频输入与静态图像合成高表现力的面部视频对生成对抗网络而言仍是一项挑战。本文中,我们提出一种基于多模态自适应归一化(MAN)的架构,以音频信号与单人图像为输入,合成任意时长的说话人视频。该架构利用多模态自适应归一化、关键点热图预测器、光流预测器以及基于类激活图[58]的层来学习富有表现力的面部部件运动,从而生成该给定人物的高表现力说话头部视频。多模态自适应归一化利用音频与视频的多种特征(如梅尔频谱、音高、音频信号能量,以及预测的关键点热图/光流与单张图像)学习相应的仿射参数以生成高表现力视频。实验评估表明,所提方法在多项量化指标(包括 SSIM(结构相似性指数)、PSNR(峰值信噪比)、CPBD(图像锐度)、WER(词错误率)、每秒眨眼次数与 LMD( landmark 距离))上优于真实语音驱动面部动画 GAN(RSDGAN)[53]、Speech2Vid [10] 及其他方法。此外,定性评估与在线图灵测试证明了我们方法的有效性。
引用
@article{arxiv.2012.07304,
title = {Multi Modal Adaptive Normalization for Audio to Video Generation},
author = {Neeraj Kumar and Srishti Goel and Ankur Narang and Brejesh Lall},
journal= {arXiv preprint arXiv:2012.07304},
year = {2020}
}