EZIGen:通过精确主体编码与解耦引导增强零样本个性化图像生成
计算机视觉与模式识别
2025-05-02 v4
摘要
零样本个性化图像生成模型旨在生成既符合给定文本提示又符合主体图像的图像,这要求模型结合这两种来源的引导。现有方法通常难以捕捉细粒度的主体细节,并且经常优先考虑其中一种引导形式而忽略另一种,导致主体编码效果不佳和生成不平衡。在本研究中,我们揭示了克服这些缺陷的关键见解,特别是:1)主体图像编码器的选择对主体身份保持和训练效率有至关重要的影响;2)文本和主体引导应在不同的去噪阶段发挥作用。基于这些见解,我们引入了一种新方法 EZIGen,它包含两个主要组件:利用固定的预训练 Diffusion UNet 本身作为主体编码器,以及通过一个分离其主导阶段并重新审视特定时间步以引导主体迁移质量的过程来平衡两种引导。通过这两个组件,最初基于 SD2.1-base 构建的 EZIGen 在多个个性化生成基准上以统一模型取得了 SOTA 性能,且使用的训练数据少 100 倍。此外,通过将我们的设计进一步迁移到 SDXL,证明 EZIGen 是一种用于个性化生成的通用模型无关解决方案。演示页面:zichengduan.github.io/pages/EZIGen/index.html
引用
@article{arxiv.2409.08091,
title = {EZIGen: Enhancing zero-shot personalized image generation with precise subject encoding and decoupled guidance},
author = {Zicheng Duan and Yuxuan Ding and Chenhui Gou and Ziqin Zhou and Ethan Smith and Lingqiao Liu},
journal= {arXiv preprint arXiv:2409.08091},
year = {2025}
}