中文

寻找 DoRI:扩散模型中保留图像的发现

计算机视觉与模式识别 2026-05-29 v3 人工智能 机器学习

摘要

文本到图像扩散模型(DM)在图像生成方面取得了显著成功。然而,由于其可能无意间记忆并复制训练数据,关于数据隐私与知识产权的担忧依然存在。近期缓解工作的重点在于识别并剪枝负责触发训练数据逐字复制的权重,其基于记忆可以被局部化这一假设。我们对该假设提出质疑,并证明即使在此类剪枝之后,对先前已缓解提示词的文本嵌入进行微小扰动也能重新触发数据复制,揭示了此类方法的脆弱性。我们的进一步分析提供了多项证据表明,记忆实际上并 \textit{不} 具有内在局部性:(1) 记忆图像的复制触发因素散布在整个文本嵌入空间中;(2) 产生相同复制图像的嵌入会产生发散的模型激活;(3) 不同的剪枝方法对同一图像识别出的记忆相关权重集不一致。最后,我们表明,通过对抗微调绕过局部性假设可以实现更稳健的缓解。这些发现为文本到图像 DM 中记忆的基本性质提供了新见解,并为未来开发更可靠的对抗 DM 记忆的缓解方法提供了参考。

关键词

引用

@article{arxiv.2507.16880,
  title  = {Finding DoRI: Discovery of Retained Images in Diffusion Models},
  author = {Antoni Kowalczuk and Dominik Hintersdorf and Lukas Struppek and Kristian Kersting and Adam Dziedzic and Franziska Boenisch},
  journal= {arXiv preprint arXiv:2507.16880},
  year   = {2026}
}

备注

Published at ICML 2026