基于动态卷积核的音频驱动说话人脸视频生成
计算机视觉与模式识别
2022-04-20 v1 多媒体
摘要
在本文中,我们提出一种用于卷积神经网络的动态卷积核(DCK)策略。利用带有所提DCK的完全卷积网络,可从多模态源(即不匹配的音频与视频)实时生成高质量的说话人脸视频,且我们训练的模型对不同身份、头部姿态与输入音频均具有鲁棒性。我们所提DCK专为音频驱动说话人脸视频生成而设计,从而构成一个简洁而有效的端到端系统。我们还提供了理论分析以解释DCK生效的原因。实验结果表明,我们的方法能以60 fps生成带背景的高质量说话人脸视频。我们的方法与最优方法之间的对比与评估证明了本方法的优越性。
引用
@article{arxiv.2201.05986,
title = {Audio-Driven Talking Face Video Generation with Dynamic Convolution Kernels},
author = {Zipeng Ye and Mengfei Xia and Ran Yi and Juyong Zhang and Yu-Kun Lai and Xuwei Huang and Guoxin Zhang and Yong-jin Liu},
journal= {arXiv preprint arXiv:2201.05986},
year = {2022}
}
备注
in IEEE Transactions on Multimedia