中文

Video2StyleGAN:在潜空间中编码视频以实现编辑

计算机视觉与模式识别 2022-06-28 v1

摘要

许多近期工作利用预训练 GAN 的潜空间进行人脸图像编辑。然而,极少有尝试将其直接应用于视频,因为 1)它们无法保证时间一致性,2)它们在视频上的处理速度限制了其应用,3)它们无法精确编码面部运动与表情的细节。为此,我们提出一种新颖网络,将人脸视频编码到 StyleGAN 的潜空间中以实现语义人脸视频编辑。基于 vision transformer,我们的网络复用潜向量的高分辨率部分以强制时间一致性。为捕捉细微的面部运动与表情,我们设计了涉及稀疏面部关键点和稠密 3D 人脸网格的新损失。我们全面评估了该方法并成功展示了其在多种人脸视频编辑中的应用。特别地,我们提出了一种在 3D 坐标系中实现姿态/表情控制的新型网络。定性与定量结果均表明,我们的方法可显著优于现有的单图像方法,同时实现实时(66 fps)速度。

关键词

引用

@article{arxiv.2206.13078,
  title  = {Video2StyleGAN: Encoding Video in Latent Space for Manipulation},
  author = {Jiyang Yu and Jingen Liu and Jing Huang and Wei Zhang and Tao Mei},
  journal= {arXiv preprint arXiv:2206.13078},
  year   = {2022}
}