中文

通过消除互信息实现无补偿文本到图像扩散模型机器遗忘

机器学习 2026-03-03 v1

摘要

扩散模型的强大生成能力引发日益增长的隐私与安全顾虑,关乎生成敏感或不良内容。应对该问题,机器遗忘(MU)——在扩散模型中常称为概念抹除(CE)——被引入以从模型参数中移除特定知识,同时保留无罪知识。尽管近期进展,但现有遗忘方法常因过度且不成比例的移除,导致无罪生成质量显著下降。为保留模型效用,先前方法依赖补偿,即重新吸收剩余数据子集或显式约束与预训练模型在剩余概念上的散度。然而,我们揭示,补偿范围之外的生成仍受影响,表明此类事后补偿在保护大规模生成模型通用效用方面本质上是不够的。因此,本文倡导发展无补偿概念抹除操作,这些操作精准识别并消除所需知识,使其他生成的影响最小。技术上,我们提出MiM-MU,通过最小化互信息实现概念遗忘,既在计算有效性上达成平衡,又维持其他概念的采样分布。广泛评估表明,我们的方法实现了有效的概念移除,同时保持其他概念的高质量生成,显著之处在于首次无需依赖事后补偿即可实现。

关键词

引用

@article{arxiv.2603.00992,
  title  = {Compensation-free Machine Unlearning in Text-to-Image Diffusion Models by Eliminating the Mutual Information},
  author = {Xinwen Cheng and Jingyuan Zhang and Zhehao Huang and Yingwen Wu and Xiaolin Huang},
  journal= {arXiv preprint arXiv:2603.00992},
  year   = {2026}
}