用于解耦文本到图像个性化的注意力校准
计算机视觉与模式识别
2024-04-12 v2
摘要
近期大规模文本到图像(T2I)模型的激动人心的进展,释放了 AI 生成内容(AIGC)前所未有的合成质量,包括图像生成、3D 和视频合成。此外,个性化技术仅需几张图像作为参考,就能实现新颖概念的吸引人的定制化生产。然而,一个有趣的问题仍然存在:能否从单张参考图像中捕获多个新颖概念?本文中,我们发现现有方法未能保持与参考图像的视觉一致性,并消除概念间的交叉影响。为缓解此问题,我们提出一种注意力校准机制,以提升 T2I 模型的概念级理解。具体来说,我们首先引入与类别绑定的新的可学习修饰符,以捕获多个概念的属性。然后,在交叉注意力操作激活后,类别被分离并强化,确保概念的全面与自包含。此外,我们抑制不同类别的注意力激活,以减轻概念间的相互影响。综上,我们提出的方法,称为 DisenDiff,能够从单张图像中学习解耦的多个概念,并生成具有所学概念的新颖定制图像。我们证明,我们的方法在定性和定量评估中均优于当前最先进技术。更重要的是,我们提出的技术与 LoRA 和修复流程兼容,从而实现更具交互性的体验。
引用
@article{arxiv.2403.18551,
title = {Attention Calibration for Disentangled Text-to-Image Personalization},
author = {Yanbing Zhang and Mengping Yang and Qin Zhou and Zhe Wang},
journal= {arXiv preprint arXiv:2403.18551},
year = {2024}
}
备注
CVPR 2024 (Oral)