APB2FaceV2:实时音频引导多人脸重演
计算机视觉与模式识别
2020-10-27 v1
摘要
音频引导人脸重演旨在生成与输入音频具有匹配面部表情的照片级真实人脸。然而,现有方法只能在模型训练后重演特定人物,或需在生成生动人脸的前提下进行3D渲染与图像后融合等额外操作。为解决上述挑战,我们提出一种名为APB2FaceV2的新颖实时音频引导多人脸重演方法,该方法以对应的参考人脸与驱动音频信号为输入,可对多人中的不同目标人脸进行重演。为使模型能够端到端训练且速度更快,我们设计了名为自适应卷积(AdaConv)的新模块将音频信息注入网络,并采用轻量网络作为主干,从而令网络可在CPU与GPU上实时运行。对比实验证明了我们的方法优于现有最先进方法,进一步实验表明我们的方法在实际应用中高效且灵活 https://github.com/zhangzjn/APB2FaceV2
引用
@article{arxiv.2010.13017,
title = {APB2FaceV2: Real-Time Audio-Guided Multi-Face Reenactment},
author = {Jiangning Zhang and Xianfang Zeng and Chao Xu and Jun Chen and Yong Liu and Yunliang Jiang},
journal= {arXiv preprint arXiv:2010.13017},
year = {2020}
}
备注
ICASSP'21