Subject-Diffusion:无需测试时微调的开放域个性化文本到图像生成
计算机视觉与模式识别
2024-05-21 v2
摘要
近期利用扩散模型的个性化图像生成进展显著。然而,在开放域且非微调的个性化图像生成领域的发展相当缓慢。本文中,我们提出Subject-Diffusion,一种新颖的开放域个性化图像生成模型,除不需要测试时微调外,仅需一张参考图像即可支持任意域中单主体或多主体的个性化生成。首先,我们构建自动数据标注工具,并使用LAION-Aesthetics数据集构建由7600万张图像及其对应的主体检测边界框、分割掩码和文本描述组成的大规模数据集。其次,我们设计了一种统一新框架,通过结合粗定位与细粒度参考图像控制来融合文本与图像语义,以最大化主体保真度与泛化性。此外,我们采用注意力控制机制以支持多主体生成。大量定性与定量结果表明,我们的方法在单主体、多主体及人像定制图像生成上优于其他SOTA框架。请参考我们的 \href{https://oppo-mente-lab.github.io/subject_diffusion/}{项目页面}
引用
@article{arxiv.2307.11410,
title = {Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning},
author = {Jian Ma and Junhao Liang and Chen Chen and Haonan Lu},
journal= {arXiv preprint arXiv:2307.11410},
year = {2024}
}
备注
Accepted by SIGGRAPH 2024