Layout-and-Retouch:用于改善个性化图像生成多样性的双阶段框架
计算机视觉与模式识别
2024-07-16 v1 人工智能
摘要
个性化 text-to-image (P-T2I) 生成旨在创建新的、以文本为导向的图像,呈现个性化主体,仅需少量参考图像。然而,在 prompt fidelity 与 identity preservation 之间保持权衡关系仍是一个关键挑战。在此基础上,我们提出了一种名为 Layout-and-Retouch 的新型 P-T2I 方法,包含两个阶段:1)布局生成和 2)修整。在第一个阶段,我们利用 vanilla T2I 模型固有的样本多样性进行 step-blended 推理,以产生多样化的布局图像,同时增强 prompt 的忠实度。在第二个阶段,multi-source attention swapping 将第一个阶段的 context 图像与参考图像集成,利用来自 context 图像的结构并从参考图像中提取视觉特征。这实现了在保持 identity 特征的同时实现高 prompt fidelity。通过大量实验,我们展示了该方法在保持个性化对象的唯一 identity 特征的同时,能够生成具有多样化布局的广泛 variety of images,即使在具有挑战性的 text prompts 下也能做到这一点。这一灵活性凸显了该框架处理复杂条件的潜力,显著增强了个性化图像合成的多样性和适用性。
引用
@article{arxiv.2407.09779,
title = {Layout-and-Retouch: A Dual-stage Framework for Improving Diversity in Personalized Image Generation},
author = {Kangyeol Kim and Wooseok Seo and Sehyun Nam and Bodam Kim and Suhyeon Jeong and Wonwoo Cho and Jaegul Choo and Youngjae Yu},
journal= {arXiv preprint arXiv:2407.09779},
year = {2024}
}