FreeCustom:无需调参的多概念组合定制图像生成
计算机视觉与模式识别
2024-05-24 v1
摘要
在大规模预训练文本到图像(T2I)生成模型的推动下,定制化图像生成取得了显著进展,旨在生成用户指定的概念。现有方法在单概念定制方面已有所探索,但在涉及组合多个概念的复杂场景时仍面临挑战。这些方法通常需要通过少量图像进行重新训练/微调,导致耗时的训练过程并阻碍其快速实现。此外,依赖多个图像表示单个概念会增加定制的难度。为此,我们提出了 FreeCustom,一种基于参考概念仅使用每个概念一个图像作为输入的无调参方法,用于生成多概念组合的定制图像。具体而言,我们引入了新的多参考自注意力(MRSA)机制和加权掩码策略,使生成图像能够访问并更关注参考概念。此外,MRSA 利用我们发现的关键点:在提供具有上下文互动的图像时,输入概念的保存效果更好。实验表明,我们的方法生成的图像与给定概念一致,且更贴合输入文本。我们的 метод 在多概念组合和单概念定制方面表现出色,甚至与其他基于训练的方法相当,但操作更简单。代码可在 https://github.com/aim-uofa/FreeCustom 查看。
引用
@article{arxiv.2405.13870,
title = {FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept Composition},
author = {Ganggui Ding and Canyu Zhao and Wen Wang and Zhen Yang and Zide Liu and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2405.13870},
year = {2024}
}
备注
CVPR2024