基于关键点与外观先验的身份保持说话人脸生成
计算机视觉与模式识别
2023-05-16 v1 多媒体
摘要
从音频生成说话人脸视频引起了大量研究兴趣。一些特定人物方法可生成生动视频,但需目标说话人的视频用于训练或微调。现有通用人物方法难以在生成逼真且唇形同步视频的同时保持身份信息。为解决此问题,我们提出一个由音频到关键点生成与关键点到视频渲染两阶段组成的框架。首先,我们设计一种基于 Transformer 的新颖关键点生成器,从音频推断嘴唇与下颌关键点。利用说话人面部的先验关键点特征,使生成的关键点与说话人的面部轮廓相吻合。随后,构建视频渲染模型将生成的关键点转化为人脸图像。在此阶段,从下半脸遮挡的目标人脸与静态参考图像中提取先验外观信息,有助于生成逼真且保持身份的可视内容。为有效利用静态参考图像的先验信息,我们基于运动场将静态参考图像与目标人脸的姿态和表情对齐。此外,复用听觉特征以保证生成的人脸图像与音频良好同步。大量实验表明,相较现有通用人物说话人脸生成方法,我们的方法能生成更逼真、唇形同步且保持身份的视频。
引用
@article{arxiv.2305.08293,
title = {Identity-Preserving Talking Face Generation with Landmark and Appearance Priors},
author = {Weizhi Zhong and Chaowei Fang and Yinqi Cai and Pengxu Wei and Gangming Zhao and Liang Lin and Guanbin Li},
journal= {arXiv preprint arXiv:2305.08293},
year = {2023}
}
备注
CVPR2023, Code: https://github.com/Weizhi-Zhong/IP_LAP