中文

λ-ECLIPSE:利用 CLIP 潜在空间的多概念个性化文本到图像扩散模型

计算机视觉与模式识别 2024-04-11 v2 计算与语言

摘要

尽管个性化文本到图像(P-T2I)生成模型近期取得了进展,但以资源高效的方式执行无需微调的多主体驱动 T2I 仍然具有挑战性。当前的主流方法涉及训练超网络和多模态大语言模型(MLLMs),需要耗费 600 到 12300 GPU 小时的庞大计算资源。这些主体驱动的 T2I 方法依赖于潜在扩散模型(LDMs),后者通过交叉注意力层实现 T2I 映射。虽然 LDMs 具有独特优势,但 P-T2I 方法对这些扩散模型潜在空间的依赖显著增加了资源需求,导致结果不一致,并且为获得单张理想图像需要大量迭代。在本文中,我们提出了 λ-ECLIPSE,这是一种替代性的先验训练策略,它在预训练 CLIP 模型的潜在空间中工作,而不依赖于扩散 UNet 模型。λ-ECLIPSE 利用图文交错预训练来实现快速有效的多主体驱动 P-T2I。通过大量实验,我们证实 λ-ECLIPSE 在组合对齐方面超越了现有基线,同时保持了概念对齐性能,即使资源利用率显著更低。λ-ECLIPSE 仅用 34M 参数执行多主体驱动 P-T2I,且仅需 74 GPU 小时的训练。此外,λ-ECLIPSE 展示了执行多概念插值的独特能力。

关键词

引用

@article{arxiv.2402.05195,
  title  = {$\lambda$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space},
  author = {Maitreya Patel and Sangmin Jung and Chitta Baral and Yezhou Yang},
  journal= {arXiv preprint arXiv:2402.05195},
  year   = {2024}
}

备注

Project page: https://eclipse-t2i.github.io/Lambda-ECLIPSE/