中文

HiFiVFS:高保真视频人脸换脸

计算机视觉与模式识别 2024-12-11 v2

摘要

人脸换脸旨在生成将源人物身份与目标属性相结合的结果。现有方法主要关注基于图像的人脸换脸。在处理视频时,每个帧被独立处理,难以确保 时间稳定性。从模型角度看,人脸换脸正逐渐从 生成对抗网络 (GAN) 转向扩散模型 (DM),因为 DM 被证明具有更强的生成能力。当前基于扩散的方法常采用 填充技术,而该技术在保持细粒度属性(如 光照和化妆)方面存在困难。为此,我们提出了 高保真视频人脸换脸 (HiFiVFS) 框架,利用 Stable Video Diffusion (SVD) 的强大生成能力和时间先验。我们构建了一个细粒度属性模块,通过 身份去感化和对抗学习提取 身份去敏感与细粒度属性特征。此外,我们引入了 详细身份注入以进一步增强身份相似性。大量实验表明,我们的方法在视频人脸换脸中实现了 state-of-the-art (SOTA) 水平,无论是定性还是定量评估都表现优异。

关键词

引用

@article{arxiv.2411.18293,
  title  = {HiFiVFS: High Fidelity Video Face Swapping},
  author = {Xu Chen and Keke He and Junwei Zhu and Yanhao Ge and Wei Li and Chengjie Wang},
  journal= {arXiv preprint arXiv:2411.18293},
  year   = {2024}
}