CP-EB:具有可控姿态与眨眼嵌入的说话人脸生成
计算机视觉与模式识别
2023-11-16 v1
摘要
本文提出一种名为“CP-EB”的说话人脸生成方法,该方法以音频信号为输入、以人物图像为参考,合成具有由短视频片段控制的头部姿态以及恰当眨眼嵌入的逼真人物说话视频。需注意,头部姿态与眨眼二者均为深度伪造检测的重要方面。已有最先进工作通过视频实现了姿态的隐式控制。根据近期研究,眨眼与输入音频相关性较弱,这意味着从音频中提取并生成眨眼是可行的。因此,我们提出一种基于 GAN 的架构,分别从输入音频与参考视频中提取眨眼特征,并在二者间进行对比训练,随后将其嵌入到身份与姿态的拼接特征中以生成说话人脸图像。实验结果表明,所提方法能够生成具有同步唇动、自然头部姿态与眨眼的逼真说话人脸。
引用
@article{arxiv.2311.08673,
title = {CP-EB: Talking Face Generation with Controllable Pose and Eye Blinking Embedding},
author = {Jianzong Wang and Yimin Deng and Ziqi Liang and Xulong Zhang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2311.08673},
year = {2023}
}
备注
Accepted by the 21st IEEE International Symposium on Parallel and Distributed Processing with Applications (IEEE ISPA 2023)