StyleGAN2 隐空间中的富有表现力说话头视频编码
计算机视觉与模式识别
2023-02-15 v2
摘要
尽管近期视频重演(reenactment)研究取得了可喜进展,但现有方法在捕获精细、详尽且富有表现力的面部特征(如抿唇、噘嘴、张嘴及皱纹)方面存在不足,而这些特征对生成逼真动画人脸视频至关重要。为此,我们提出一种端到端富有表现力人脸视频编码方法,通过对单一身份隐变量(Identity-latent)的低维编辑进行优化,实现数据高效的高质量视频重合成。该方法基于 StyleGAN2 图像反演与多阶段非线性隐空间编辑,生成近乎媲美输入视频的结果。现有基于 StyleGAN 隐变量的编辑技术仅关注静态图像的合理编辑,而我们自动化隐空间编辑,利用位于 StyleGAN2 风格隐空间(StyleSpace)中的编码捕获连续帧中的精细富有表现力面部形变。由此获得的编码可叠加于单一身份隐变量之上,以在 分辨率下实现人脸视频重演。所提框架以精细层级经济地捕获人脸身份、头部姿态及复杂富有表现力面部运动,从而规避了训练、人物建模、对关键点/landmarks 的依赖以及低分辨率合成等往往制约多数重演方法的问题。该方案以最大数据效率设计,仅需单个 隐变量与每帧 35 个参数即可实现高保真视频渲染。该流程亦可用于傀儡驱动(即运动迁移)。
引用
@article{arxiv.2203.14512,
title = {Expressive Talking Head Video Encoding in StyleGAN2 Latent-Space},
author = {Trevine Oorloff and Yaser Yacoob},
journal= {arXiv preprint arXiv:2203.14512},
year = {2023}
}
备注
The project page is located at https://trevineoorloff.github.io/ExpressiveFaceVideoEncoding.io/