中文

DiffusionAct:用于单样本面部重现的可控扩散自编码器

计算机视觉与模式识别 2025-03-26 v2 人工智能

摘要

视频驱动的神经面部重现旨在合成逼真的面部图像,这些图像成功保留源面部的身份和外观,同时迁移目标头部姿态和面部表情。现有的基于生成对抗网络(GAN)的方法要么存在失真和视觉伪影,要么重建质量差,即背景和一些重要的外观细节(如发型/颜色、眼镜和配饰)未能被忠实重建。扩散概率模型(Diffusion Probabilistic Models, DPMs)的最新进展使得生成高质量逼真图像成为可能。为此,在本文中我们提出了DiffusionAct,这是一种利用扩散模型逼真图像生成能力来执行神经面部重现的新方法。具体来说,我们提出控制扩散自编码器(Diffusion Autoencoder, DiffAE)的语义空间,以编辑输入图像的面部姿态,该姿态定义为头部姿态方向和面部表情。我们的方法允许单样本、自身和跨主体重现,无需针对特定主体进行微调。我们与最先进的基于GAN、StyleGAN2和扩散的方法进行了比较,展示了更好或持平的重现性能。

关键词

引用

@article{arxiv.2403.17217,
  title  = {DiffusionAct: Controllable Diffusion Autoencoder for One-shot Face Reenactment},
  author = {Stella Bounareli and Christos Tzelepis and Vasileios Argyriou and Ioannis Patras and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2403.17217},
  year   = {2025}
}

备注

Project page: https://stelabou.github.io/diffusionact/