LatRef-Diff: 基于潜空间和参考引导的扩散模型用于面部属性编辑与风格操控
计算机视觉与模式识别
2026-04-24 v1
摘要
面部属性编辑和风格操控对于虚拟头像和照片编辑等应用至关重要. 然而,由于面部结构的复杂性以及属性之间的强关联,实现对面部属性的精确控制而不影响无关特征具有挑战性. 虽然条件 GAN 在此方面取得了进展,但受限于准确性问题和训练不稳定. 扩散模型虽前景光明,但因语义方向的表达力有限面临风格操控挑战. 本文提出 LatRef-Diff,一个新型基于扩散的框架,以解决这些局限性. 我们取代扩散模型中的传统语义方向,采用风格代码,并提出两种生成方法:潜空间引导和参考引导. 基于这些风格代码,我们设计风格调制模块将其集成到目标图像中,实现随机和定制风格操控. 该模块包含可学习向量、跨注意力机制和层次化设计,以提高准确性和图像质量. 此外,为提升训练稳定性且无需配对图像(如编辑前后图像),我们提出前向-后向一致性训练策略:首先通过图像特定语义方向约略移除目标属性,然后通过风格调制恢复,以感知损失和分类损失为指导. 在 CelebA-HQ 上的大量实验表明,LatRef-Diff 在定性和定量评估中实现了最先进的性能. 消融研究验证了模型设计选择的有效性.
引用
@article{arxiv.2604.21279,
title = {LatRef-Diff: Latent and Reference-Guided Diffusion for Facial Attribute Editing and Style Manipulation},
author = {Wenmin Huang and Weiqi Luo and Xiaochun Cao and Jiwu Huang},
journal= {arXiv preprint arXiv:2604.21279},
year = {2026}
}