PIDiff:基于扩散模型的个性化身份图像定制
计算机视觉与模式识别
2025-05-13 v2
摘要
文本到图像生成旨在通过文本提示和身份图像将特定身份融入生成图像。基于 DDPM 的强大生成能力,许多先前方法采用额外提示(如文本嵌入和 CLIP 图像嵌入)来表示身份信息,但未能解耦身份信息与背景信息。结果导致生成图像不仅丢失关键身份特征,还显著降低多样性。为此,先前方法将 StyleGAN 的 W+ 空间与扩散模型结合,利用该空间通过多层特征提取提供更准确和全面的身份特征表示。然而,面对野外图像在训练期间的身份与背景信息纠缠,难以实现准确身份定位,导致身份与背景之间严重的语义干扰。本文提出一种新型微调扩散模型用于身份文本到图像生成,称为 PIDiff,利用 W+ 空间和身份针对性微调策略以避免语义纠缠,实现准确特征提取与定位。PIDiff 还能通过保留 W+ 空间中身份特征的特性实现风格编辑,这些特性从粗到细各不相同。通过结合提出的跨注意力块和参数优化策略,PIDiff 在推理阶段保留身份信息,同时维持预训练模型对野外图像的生成能力。我们的实验结果验证了本方法在该任务中的有效性。
引用
@article{arxiv.2505.05081,
title = {PIDiff: Image Customization for Personalized Identities with Diffusion Models},
author = {Jinyu Gu and Haipeng Liu and Meng Wang and Yang Wang},
journal= {arXiv preprint arXiv:2505.05081},
year = {2025}
}
备注
9 pages, 11 figures