鲁棒的一次性音频到视频生成
计算机视觉与模式识别
2020-12-16 v1
摘要
音频到视频生成是一个有趣的问题,在包括电影制作、多媒体、营销、教育等诸多行业领域具有广泛应用。具有富有表现力面部运动的高质量视频生成是一个具有挑战性的问题,涉及生成对抗网络的复杂学习步骤。此外,为未见过的单张图像启用一次性学习在增加问题复杂度的同时,也使其更适用于实际场景。在本文中,我们提出一种新颖方法 OneShotA2V,以音频信号和人物的单张未见图像作为输入,合成任意长度的说话人物视频。OneShotA2V 利用课程学习来学习富有表现力的面部部件的运动,从而生成给定人物的高质量说话头部视频。此外,它将音频输入生成的特征直接送入生成对抗网络,并通过仅少量输出更新轮次的少样本学习适配任意给定的未见自拍图像。OneShotA2V 采用基于空间自适应归一化的多级生成器与基于多个多级判别器的架构。输入音频片段不限于任何特定语言,使该方法具备多语言适用性。实验评估表明,在 SSIM(结构相似性指数)、PSNR(峰值信噪比)和 CPBD(图像清晰度)等多个量化指标上,OneShotA2V 相较于 Realistic Speech-Driven Facial Animation with GANs(RSDGAN) [43]、Speech2Vid [8] 及其他方法具有更优性能。进一步的定性评估与在线图灵测试证明了我们方法的有效性。
引用
@article{arxiv.2012.07842,
title = {Robust One Shot Audio to Video Generation},
author = {Neeraj Kumar and Srishti Goel and Ankur Narang and Mujtaba Hasan},
journal= {arXiv preprint arXiv:2012.07842},
year = {2020}
}
备注
Accepted in CVPR Deep Vision 2020. arXiv admin note: text overlap with arXiv:2012.07304