MINDiff:用于控制文本到图像个人化中的过拟合的掩码集成负面注意
计算机视觉与模式识别
2025-11-25 v1
摘要
在大规模文本到图像模型的个人化过程中,当从有限数量的图像中学习特定主题时,常发生过拟合。现有方法如 DreamBooth 通过类特定的先验保持损失来缓解此问题,但在训练期间需要增加计算成本,且在推理时间限制用户控制。为克服这些限制,我们提出了 Mask-Integrated Negative Attention Diffusion(MINDiff)。MINDiff 引入了一种新概念——负面注意——通过修改推理时的交叉注意力机制来抑制在被掩码屏蔽的无关区域中主题的影响。这实现了语义控制并通过减少无关区域中主题的主导作用来提高文本对齐。此外,在推理时间,用户可调整比例参数 lambda 在主题保真度和文本对齐之间进行权衡。我们的定性和定量实验在 DreamBooth 模型上表明,MINDiff 比类特定的先验保持损失更有效地缓解了过拟合问题。由于该方法完全在推理时间运行且不改变模型体系结构,因此可直接应用于现有的 DreamBooth 模型而无需重新训练。我们的代码已公开于 https://github.com/seuleepy/MINDiff。
引用
@article{arxiv.2511.17888,
title = {MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization},
author = {Seulgi Jeong and Jaeil Kim},
journal= {arXiv preprint arXiv:2511.17888},
year = {2025}
}
备注
Accepted at ICCV 2025 Personalization in Generative AI Workshop