中文

StyleFaceV:通过分解与重组预训练 StyleGAN3 生成人脸视频

计算机视觉与模式识别 2022-08-17 v1

摘要

逼真的生成式人脸视频合成长期以来是计算机视觉与图形学界的追求。然而,现有人脸视频生成方法往往产生低质量帧,伴随面部身份漂移与不自然运动。为应对这些挑战,我们提出一个名为 StyleFaceV 的原则性框架,其可生成具有高保真度、身份保持且运动生动的人脸视频。我们的核心洞见是在 StyleGAN3 的潜空间中分解外观与姿态信息并重新组合,以产生稳定且动态的结果。具体而言,StyleGAN3 为高保真面部图像生成提供了强先验,但其潜空间本质上是纠缠的。通过仔细考察其潜空间属性,我们提出分解与重组设计,以实现面部外观与运动的解耦组合。此外,在分解后的潜特征上构建时序依赖模型,并采样合理的运动序列,从而能够生成逼真且时间连贯的人脸视频。特别地,我们的流程采用静态图像与高质量视频数据上的联合训练策略,具有更高的数据效率。大量实验表明,我们的框架在定性与定量上均取得了最先进(SOTA)的人脸视频生成结果。值得注意的是,即便没有高分辨率训练视频,StyleFaceV 也能生成逼真的 1024×10241024\times1024 人脸视频。

关键词

引用

@article{arxiv.2208.07862,
  title  = {StyleFaceV: Face Video Generation via Decomposing and Recomposing Pretrained StyleGAN3},
  author = {Haonan Qiu and Yuming Jiang and Hang Zhou and Wayne Wu and Ziwei Liu},
  journal= {arXiv preprint arXiv:2208.07862},
  year   = {2022}
}

备注

Project Page: http://haonanqiu.com/projects/StyleFaceV.html; Code Repo: https://github.com/arthur-qiu/StyleFaceV