中文

StyleAvatar:基于单视频的实时照片级真实感肖像化身

计算机视觉与模式识别 2023-05-02 v1

摘要

人脸重演方法试图尽可能真实地恢复并重新驱动肖像视频。现有方法在质量与可控性之间面临困境:基于2D GAN的方法相比3D对应方法取得了更高的图像质量,但在面部属性的细粒度控制上表现不佳。在本工作中,我们提出StyleAvatar,一种使用基于StyleGAN的网络的实时照片级真实感肖像化身重建方法,其可生成具有高保真度且具备忠实表情控制的肖像化身。我们通过引入组合式表示与滑动窗口增强方法扩展了StyleGAN的能力,从而实现更快收敛并改善迁移泛化性。具体而言,我们将肖像场景划分为三部分以进行自适应调整:面部区域、非面部前景区域与背景。此外,我们的网络融合了UNet、StyleGAN与时间编码在视频学习中的优势,实现了高质量视频生成。进一步地,我们分别提出滑动窗口增强方法与预训练策略,以分别改善迁移泛化性与训练性能。所提网络可在两小时内收敛,同时确保高图像质量与仅20毫秒的前向渲染时间。此外,我们提出一个实时直播系统,进一步将研究推向应用。结果与实验证明了我们的方法在图像质量、完整肖像视频生成以及实时重演方面相较现有面部重演方法的优越性。本文的训练与推理代码见 https://github.com/LizhenWangT/StyleAvatar。

关键词

引用

@article{arxiv.2305.00942,
  title  = {StyleAvatar: Real-time Photo-realistic Portrait Avatar from a Single Video},
  author = {Lizhen Wang and Xiaochen Zhao and Jingxiang Sun and Yuxiang Zhang and Hongwen Zhang and Tao Yu and Yebin Liu},
  journal= {arXiv preprint arXiv:2305.00942},
  year   = {2023}
}

备注

8 pages, 5 figures, SIGGRAPH 2023 Conference Proceedings