StyleHEAT:基于预训练 StyleGAN 的一次性高分辨率可编辑说话人脸生成
计算机视觉与模式识别
2022-03-18 v2
摘要
一次性说话人脸生成旨在由任意肖像图像驱动,通过视频或音频片段合成高质量的说话人脸视频。一个具有挑战性的质量因素是输出视频的分辨率:更高的分辨率传达更多细节。在本工作中,我们探究预训练 StyleGAN 的潜在特征空间,并发现一些优异的空间变换性质。基于该观察,我们探索使用预训练 StyleGAN 突破训练数据集的分辨率限制。我们提出一种基于预训练 StyleGAN 的新型统一框架,其实现一组强大功能,即高分辨率视频生成、由驱动视频或音频解耦控制,以及灵活的人脸编辑。我们的框架首次将合成说话人脸的分辨率提升至 1024*1024,即便训练数据集分辨率更低。我们设计了一个基于视频的运动生成模块和一个基于音频的运动生成模块,它们可单独或联合插入框架以驱动视频生成。预测的运动用于变换 StyleGAN 的潜在特征以实现视觉动画。为补偿变换畸变,我们提出一个校准网络以及一种域损失来精炼特征。此外,我们的框架允许两类人脸编辑,即经由 GAN 反演的全局编辑和基于三维可变形模型的直观编辑。综合实验表明,相较于最先进的方法,本方法具有更优的视频质量、灵活的可控性与可编辑性。
引用
@article{arxiv.2203.04036,
title = {StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGAN},
author = {Fei Yin and Yong Zhang and Xiaodong Cun and Mingdeng Cao and Yanbo Fan and Xuan Wang and Qingyan Bai and Baoyuan Wu and Jue Wang and Yujiu Yang},
journal= {arXiv preprint arXiv:2203.04036},
year = {2022}
}
备注
Project Page is at http://feiiyin.github.io/StyleHEAT/