AttenCraft:基于注意力机制的多概念文本到图像自定义解耦
计算机视觉与模式识别
2025-10-17 v2
摘要
文本到图像 (T2I) 定制化允许用户将 T2I 扩散模型适配到预训练数据集中不存在的新概念。基于此,从单张图像中捕获多个新概念已成为一种新任务,使模型能够同时学习多个概念或丢弃不需要的概念。然而,多概念解耦仍是关键挑战。现有解耦模型常 exhibit 两大主要问题:特征融合和跨不同概念的异步学习。为解决这些问题,我们提出了 AttenCraft,一种用于多概念解耦的注意力方法。我们的方法利用注意力图为每个概念生成准确的掩码,实现单次初始化即可完成概念解耦,无需人工或专用模型准备掩码。此外,我们引入一种基于注意力得分的自适应算法,用于估计不同概念的抽样比率,以促进特征获取的平衡和同步学习。AttenCraft 还引入一种保留特征的训练框架,采用多种损失函数以增强特征识别并防止融合。广泛的实验表明,我们的模型有效缓解了这两个问题,实现了引人注目的图像保真度,并与基线模型相当的提示保真度。
引用
@article{arxiv.2405.17965,
title = {AttenCraft: Attention-guided Disentanglement of Multiple Concepts for Text-to-Image Customization},
author = {Junjie Shentu and Matthew Watson and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2405.17965},
year = {2025}
}