中文

MS-Diffusion:基于布局引导的多主体零样本图像个性化

计算机视觉与模式识别 2025-03-05 v3

摘要

文本到图像生成模型的最新进展极大地增强了从文本提示生成逼真图像的能力,从而引发了对个性化文本到图像应用(尤其是在多主体场景中)的日益关注。然而,这些进展受到两个主要挑战的阻碍:首先,需要根据文本描述精确保持每个参考主体的细节;其次,难以在单张图像中实现多个主体的连贯表示而不引入不一致性。为解决这些问题,我们的研究引入了MS-Diffusion框架,用于多主体布局引导的零样本图像个性化。这种创新方法将接地标记与特征重采样器相结合,以保持主体间的细节保真度。借助布局引导,MS-Diffusion进一步改进了交叉注意力机制以适应多主体输入,确保每个主体条件作用于特定区域。所提出的多主体交叉注意力机制在保持文本控制的同时,协调了和谐的主体间构图。全面的定量和定性实验证实,该方法在图像和文本保真度方面均超越了现有模型,促进了个性化文本到图像生成的发展。项目页面为https://MS-Diffusion.github.io。

关键词

引用

@article{arxiv.2406.07209,
  title  = {MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance},
  author = {Xierui Wang and Siming Fu and Qihan Huang and Wanggui He and Hao Jiang},
  journal= {arXiv preprint arXiv:2406.07209},
  year   = {2025}
}