基于预训练文本到图像扩散模型的个性化图像编辑能量引导优化
计算机视觉与模式识别
2025-03-07 v1
摘要
预训练文本驱动扩散模型的快速发展显著丰富了图像生成和编辑应用。然而,随着对个性化内容编辑需求的增加,新的挑战随之出现,尤其是在处理任意物体和复杂场景时。现有方法通常将掩码误认为物体形状先验,难以实现无缝融合结果。最常用的逆噪声初始化也阻碍了与目标物体的身份一致性。为解决这些挑战,我们提出了一种无训练框架,将个性化内容编辑表述为隐空间中编辑图像的优化,使用扩散模型作为能量函数引导,以参考文本-图像对为条件。我们提出了一种由粗到细的策略,在早期阶段采用文本能量引导以实现对目标类别的自然过渡,并使用逐点特征级图像能量引导实现对目标物体的细粒度外观对齐。此外,我们引入隐空间内容组合以增强与目标的整体身份一致性。大量实验表明,我们的方法在物体替换方面表现出色,即使存在较大的领域差距,突显了其在高质量个性化图像编辑中的潜力。
引用
@article{arxiv.2503.04215,
title = {Energy-Guided Optimization for Personalized Image Editing with Pretrained Text-to-Image Diffusion Models},
author = {Rui Jiang and Xinghe Fu and Guangcong Zheng and Teng Li and Taiping Yao and Xi Li},
journal= {arXiv preprint arXiv:2503.04215},
year = {2025}
}