中文

无意识遗忘:在不知晓被遗忘内容的前提下减轻记忆化

计算机视觉与模式识别 2025-12-15 v2

摘要

近期生成模型的进展显示,其在生成高度逼真图像方面具有卓越能力。然而,已有研究表明,生成的图像常常接近于训练数据,随着模型规模的增大,这一问题尤为突出。记忆化训练数据可能导致法律挑战,包括侵犯版权、侵犯肖像权及侵犯商标权等。现有方法主要通过操控去噪采样过程以引导图像嵌入偏离记忆化嵌入空间,或采用需要在包含特定记忆化概念数据集上训练的无学习方法。然而,这些方法在采样过程中往往产生显著的计算开销,或仅针对性地移除一或多个目标概念,限制了其可扩展性。为理解和缓解这些问题,我们的工作 UniForget 提出了新的视角来理解记忆化的根本原因。我们的工作表明,模型的特定部分负责版权内容的生成。通过应用模型剪枝,我们可以在不针对特定概念的前提下有效抑制生成版权内容的概率,同时保持模型的一般生成能力。此外,我们展示了该方法与现有无学习方法是正交且互补的,从而凸显了其改进当前无学习和去记忆技术的潜力。

关键词

引用

@article{arxiv.2512.09687,
  title  = {Unconsciously Forget: Mitigating Memorization; Without Knowing What is being Memorized},
  author = {Er Jin and Yang Zhang and Yongli Mou and Yanfei Dong and Stefan Decker and Kenji Kawaguchi and Johannes Stegmaier},
  journal= {arXiv preprint arXiv:2512.09687},
  year   = {2025}
}