中文

AttenCraft:基于注意力机制的多概念文本到图像自定义解耦

计算机视觉与模式识别 2025-10-17 v2

摘要

文本到图像 (T2I) 定制化允许用户将 T2I 扩散模型适配到预训练数据集中不存在的新概念。基于此,从单张图像中捕获多个新概念已成为一种新任务,使模型能够同时学习多个概念或丢弃不需要的概念。然而,多概念解耦仍是关键挑战。现有解耦模型常 exhibit 两大主要问题:特征融合和跨不同概念的异步学习。为解决这些问题,我们提出了 AttenCraft,一种用于多概念解耦的注意力方法。我们的方法利用注意力图为每个概念生成准确的掩码,实现单次初始化即可完成概念解耦,无需人工或专用模型准备掩码。此外,我们引入一种基于注意力得分的自适应算法,用于估计不同概念的抽样比率,以促进特征获取的平衡和同步学习。AttenCraft 还引入一种保留特征的训练框架,采用多种损失函数以增强特征识别并防止融合。广泛的实验表明,我们的模型有效缓解了这两个问题,实现了引人注目的图像保真度,并与基线模型相当的提示保真度。

关键词

引用

@article{arxiv.2405.17965,
  title  = {AttenCraft: Attention-guided Disentanglement of Multiple Concepts for Text-to-Image Customization},
  author = {Junjie Shentu and Matthew Watson and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2405.17965},
  year   = {2025}
}