中文

StyleGAN2 隐空间中的富有表现力说话头视频编码

计算机视觉与模式识别 2023-02-15 v2

摘要

尽管近期视频重演(reenactment)研究取得了可喜进展,但现有方法在捕获精细、详尽且富有表现力的面部特征(如抿唇、噘嘴、张嘴及皱纹)方面存在不足,而这些特征对生成逼真动画人脸视频至关重要。为此,我们提出一种端到端富有表现力人脸视频编码方法,通过对单一身份隐变量(Identity-latent)的低维编辑进行优化,实现数据高效的高质量视频重合成。该方法基于 StyleGAN2 图像反演与多阶段非线性隐空间编辑,生成近乎媲美输入视频的结果。现有基于 StyleGAN 隐变量的编辑技术仅关注静态图像的合理编辑,而我们自动化隐空间编辑,利用位于 StyleGAN2 风格隐空间(StyleSpace)中的编码捕获连续帧中的精细富有表现力面部形变。由此获得的编码可叠加于单一身份隐变量之上,以在 102421024^2 分辨率下实现人脸视频重演。所提框架以精细层级经济地捕获人脸身份、头部姿态及复杂富有表现力面部运动,从而规避了训练、人物建模、对关键点/landmarks 的依赖以及低分辨率合成等往往制约多数重演方法的问题。该方案以最大数据效率设计,仅需单个 W+W+ 隐变量与每帧 35 个参数即可实现高保真视频渲染。该流程亦可用于傀儡驱动(即运动迁移)。

关键词

引用

@article{arxiv.2203.14512,
  title  = {Expressive Talking Head Video Encoding in StyleGAN2 Latent-Space},
  author = {Trevine Oorloff and Yaser Yacoob},
  journal= {arXiv preprint arXiv:2203.14512},
  year   = {2023}
}

备注

The project page is located at https://trevineoorloff.github.io/ExpressiveFaceVideoEncoding.io/