中文

FastComposer:基于局部化注意力且无需微调的多主体图像生成

计算机视觉与模式识别 2023-05-23 v2

摘要

扩散模型在文本到图像生成方面表现出色,尤其在用于个性化图像的主体驱动生成中。然而,现有方法由于针对特定主体进行微调而效率低下,这种微调计算密集且阻碍了高效部署。此外,现有方法在多主体生成中表现不佳,因为它们常常在主体间混淆特征。我们提出 FastComposer,它无需微调即可实现高效、个性化、多主体的文本到图像生成。FastComposer 使用图像编码器提取的主体嵌入来增强扩散模型中通用的文本条件,仅通过前向传播即可基于主体图像和文本指令生成个性化图像。为解决多主体生成中的身份混淆问题,FastComposer 在训练中提出交叉注意力局部化监督,强制参考主体在目标图像中正确区域上的注意力局部化。朴素地以主体嵌入为条件会导致主体过拟合。FastComposer 提出在去噪步骤中延迟主体条件,以在主体驱动图像生成中同时保持身份与可编辑性。FastComposer 可生成具有不同风格、动作和上下文的多个未见个体的图像。与基于微调的方法相比,它实现了 300×\times-2500×\times 的加速,且对新主体无需额外存储。FastComposer 为高效、个性化、高质量的多主体图像创作铺平了道路。代码、模型和数据集可在 https://github.com/mit-han-lab/fastcomposer 获取。

关键词

引用

@article{arxiv.2305.10431,
  title  = {FastComposer: Tuning-Free Multi-Subject Image Generation with Localized Attention},
  author = {Guangxuan Xiao and Tianwei Yin and William T. Freeman and Frédo Durand and Song Han},
  journal= {arXiv preprint arXiv:2305.10431},
  year   = {2023}
}

备注

The first two authors contributed equally to this work