基于语义潜在扩散模型的可控人脸合成
计算机视觉与模式识别
2025-04-30 v2
摘要
语义图像合成(SIS)凭借其良好的生成质量及其带来的多功能性,成为人脸生成与编辑领域中最受欢迎且最有效的技术之一。近期的工作试图超越基于 GAN 的标准框架,并开始探索用于此任务的扩散模型,因为它们在质量和多样性方面均优于 GAN。另一方面,扩散模型缺乏细粒度的可控性和可复现性。为了解决这一问题,在本文中,我们提出了一种基于新颖潜在扩散模型架构的 SIS 框架,用于人脸生成与编辑,该框架既能复现和操纵真实参考图像,又能生成多样性驱动的结果。所提出的系统利用 SPADE 归一化和交叉注意力层来融合形状与风格信息,借此允许对人脸的每个语义部分进行精确控制。这是先前领域内方法无法实现的。最后,我们进行了大量实验,从定性和定量两方面证明我们的模型超越了当前领域内最新技术水平。
引用
@article{arxiv.2403.12743,
title = {Controllable Face Synthesis with Semantic Latent Diffusion Models},
author = {Alex Ergasti and Claudio Ferrari and Tomaso Fontanini and Massimo Bertozzi and Andrea Prati},
journal= {arXiv preprint arXiv:2403.12743},
year = {2025}
}