你不需要所有注意力:文本到图像扩散模型中手术式记忆减缓
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
生成模型被证明会“记忆”特定训练数据,导致生成字面或近字面图像,这可能引发隐私顾虑或版权侵权。我们引入Guidance Using Attractive-Repulsive Dynamics(GUARD)框架,这是一种针对文本到图像扩散模型进行记忆减缓的新方法。GUARD调整图像去噪过程,以引导生成远离原始训练图像,同时保持与提示一致,守卫生成过程不得不复现训练数据,同时不损害图像生成质量。我们提出了该框架的具体实现,其中我们引导的正目标由一种新方法提供,该方法基于(i)一种新型统计机制自动识别必须减弱交叉注意力的提示位置,以及(ii)在这些提示位置上减弱交叉注意力。 resulting GUARD 提供了一种手术式、动态的、基于推理时的逐提示方法,我们发现它在两个架构上对于字面和模板记忆减缓,都表现出最佳的鲁棒性,同时在图像质量方面也优于或相当于其他方法。
引用
@article{arxiv.2603.00133,
title = {You Don't Need All That Attention: Surgical Memorization Mitigation in Text-to-Image Diffusion Models},
author = {Kairan Zhao and Eleni Triantafillou and Peter Triantafillou},
journal= {arXiv preprint arXiv:2603.00133},
year = {2026}
}