APB2Face:基于辅助姿态与眨眼信号的音频引导人脸重演
计算机视觉与模式识别
2020-05-01 v1 机器学习
图像与视频处理
摘要
音频引导人脸重演旨在利用音频信息生成照片级真实人脸,同时保持与真人说话时相同的面部运动。然而,现有方法无法生成生动人脸图像或仅能重演低分辨率人脸,限制了应用价值。为解决这些问题,我们提出一种名为APB2Face的新型深度神经网络,其由GeometryPredictor和FaceReenactor模块组成。GeometryPredictor利用额外的头部姿态和眨眼状态信号以及音频来预测潜在关键点几何信息,而FaceReenactor输入人脸关键点图像以重演照片级真实人脸。我们提出从YouTube收集的新数据集AnnVI以支持该方法,实验结果表明我们的方法在真实感或可控性上均优于现有最优方法。
引用
@article{arxiv.2004.14569,
title = {APB2Face: Audio-guided face reenactment with auxiliary pose and blink signals},
author = {Jiangning Zhang and Liang Liu and Zhucun Xue and Yong Liu},
journal= {arXiv preprint arXiv:2004.14569},
year = {2020}
}
备注
ICASSP 2020