AttnDreamBooth:面向文本对齐的个性化文本到图像生成
计算机视觉与模式识别
2024-06-10 v1
摘要
文本到图像模型的最新进展使得能够对用户提供的概念进行高质量的个性化图像合成,并具有灵活的文本控制。在这项工作中,我们分析了文本到图像个性化中两种主要技术的局限性:文本反转和DreamBooth。当将学习到的概念整合到新提示中时,文本反转倾向于过拟合概念,而DreamBooth则经常忽略它。我们将这些问题归因于概念嵌入对齐的错误学习。我们引入了AttnDreamBooth,一种新颖的方法,通过在不同训练阶段分别学习嵌入对齐、注意力图和主体身份来解决这些问题。我们还引入了一个交叉注意力图正则化项来增强注意力图的学习。与基线方法相比,我们的方法在身份保持和文本对齐方面表现出显著改进。
引用
@article{arxiv.2406.05000,
title = {AttnDreamBooth: Towards Text-Aligned Personalized Text-to-Image Generation},
author = {Lianyu Pang and Jian Yin and Baoquan Zhao and Feize Wu and Fu Lee Wang and Qing Li and Xudong Mao},
journal= {arXiv preprint arXiv:2406.05000},
year = {2024}
}