中文

DisControlFace:为扩散自编码器添加解耦控制以实现一次性显式面部图像编辑

计算机视觉与模式识别 2024-07-25 v2

摘要

在这项工作中,我们专注于探索生成式面部图像编辑的显式细粒度控制,同时生成逼真的面部外观和一致的语义细节,然而这极具挑战性且尚未被广泛探索,尤其是在一次性场景下。我们将关键挑战识别为在生成过程中探索高层语义与显式参数(例如,3DMM)之间的解耦条件控制,并据此提出了一个新颖的基于扩散的编辑框架,名为DisControlFace。具体来说,我们利用扩散自编码器(Diff-AE)作为语义重建的骨干网络。为了实现显式面部编辑,我们构建了一个与Diff-AE兼容的Exp-FaceNet,以基于估计的3DMM参数生成空间级的显式控制条件。与当前从头训练整个条件生成模型的基于扩散的编辑方法不同,我们冻结了Diff-AE的预训练权重以保持其语义确定性条件控制能力,并相应地提出了一种随机语义掩码(RSM)策略,以有效实现Exp-FaceNet的独立训练。这种设置赋予了模型解耦的面部控制能力,同时减少了编辑中的语义信息偏移。我们的模型可以使用二维自然肖像图像进行训练,无需三维或视频数据,并通过简单的一次性微调对任何新面部图像执行鲁棒的编辑。综合实验表明,DisControlFace能够生成逼真的面部图像,在编辑准确性和身份保持方面优于最先进的方法。项目页面:https://discontrolface.github.io/

关键词

引用

@article{arxiv.2312.06193,
  title  = {DisControlFace: Adding Disentangled Control to Diffusion Autoencoder for One-shot Explicit Facial Image Editing},
  author = {Haozhe Jia and Yan Li and Hengfei Cui and Di Xu and Yuwang Wang and Tao Yu},
  journal= {arXiv preprint arXiv:2312.06193},
  year   = {2024}
}