DreamSalon:一种用于可编辑人脸生成中保持身份与上下文的分阶段扩散框架
计算机视觉与模式识别
2024-03-29 v1
摘要
尽管大规模预训练文本到图像模型能够合成多样化且高质量的人物图像,但“身份精细编辑”这一精细任务带来了新的挑战:在精确修改主体特定特征的同时,保持其固有的身份和上下文。现有的个性化方法要么需要耗时的优化,要么需要学习额外的编码器,它们擅长“身份重新上下文化”。然而,它们在处理人脸编辑这类精细且敏感的任务时往往力不从心。为了应对这些挑战,我们引入了 DreamSalon,一种噪声引导的分阶段编辑框架,独特地专注于精细图像操作和身份上下文保持。通过预测噪声的频率和梯度来区分编辑和提升阶段,DreamSalon 首先在编辑阶段利用高频信息对特定特征进行精细操作,然后在提升阶段采用随机去噪以提高图像质量。为了实现更精确的编辑,DreamSalon 在其嵌入协方差的差异引导下,对源文本提示和目标文本提示进行语义混合,以引导模型关注特定操作区域。我们的实验表明,DreamSalon 能够高效且忠实地编辑人脸的精细细节,在定性和定量上均优于现有方法。
引用
@article{arxiv.2403.19235,
title = {DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation},
author = {Haonan Lin and Mengmeng Wang and Yan Chen and Wenbin An and Yuzhe Yao and Guang Dai and Qianying Wang and Yong Liu and Jingdong Wang},
journal= {arXiv preprint arXiv:2403.19235},
year = {2024}
}