中文

你不需要所有注意力:文本到图像扩散模型中手术式记忆减缓

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

生成模型被证明会“记忆”特定训练数据,导致生成字面或近字面图像,这可能引发隐私顾虑或版权侵权。我们引入Guidance Using Attractive-Repulsive Dynamics(GUARD)框架,这是一种针对文本到图像扩散模型进行记忆减缓的新方法。GUARD调整图像去噪过程,以引导生成远离原始训练图像,同时保持与提示一致,守卫生成过程不得不复现训练数据,同时不损害图像生成质量。我们提出了该框架的具体实现,其中我们引导的正目标由一种新方法提供,该方法基于(i)一种新型统计机制自动识别必须减弱交叉注意力的提示位置,以及(ii)在这些提示位置上减弱交叉注意力。 resulting GUARD 提供了一种手术式、动态的、基于推理时的逐提示方法,我们发现它在两个架构上对于字面和模板记忆减缓,都表现出最佳的鲁棒性,同时在图像质量方面也优于或相当于其他方法。

关键词

引用

@article{arxiv.2603.00133,
  title  = {You Don't Need All That Attention: Surgical Memorization Mitigation in Text-to-Image Diffusion Models},
  author = {Kairan Zhao and Eleni Triantafillou and Peter Triantafillou},
  journal= {arXiv preprint arXiv:2603.00133},
  year   = {2026}
}