中文

扩散模型中的稳健概念抹除:安全性与鲁棒性的理论视角

计算机视觉与模式识别 2025-10-08 v2

摘要

扩散模型在图像生成方面取得了空前的成功,但在隐私、公平性和安全性方面日益增加风险。迫切需要\emph{抹除}敏感或有害概念(如NSFW内容、私人个体、艺术风格)以保留其整体生成能力。我们引入SCORE(Secure and Concept-Oriented Robust Erasure,安全与概念导向稳健抹除),一种用于扩散模型稳健概念移除的新框架。SCORE将概念抹除形式化为\emph{对抗独立性}问题,理论上保证模型输出与被抹除概念在统计上独立。不同于先前的启发式方法,SCORE最小化目标概念与生成输出之间的互信息,实现可证明的抹除保证。我们提供形式证明,建立收敛性质,并推导出残余概念泄露的上界。在实验中,我们在Stable Diffusion和FLUX上评估了SCORE,针对四个具有挑战性的基准测试:对象抹除、NSFW移除、明星人脸抑制和艺术风格遗忘。SCORE在 EraseAnything、ANT、MACE、ESD和UCE等最先进方法中持续领先,实现最高可达\textbf{12.5\%}的提升,同时保持或优于原有图像质量。通过集成对抗优化、轨迹一致性和显著性驱动的微调,SCORE为扩散模型的安全与稳健概念抹除树立了新标准。

引用

@article{arxiv.2509.12024,
  title  = {Robust Concept Erasure in Diffusion Models: A Theoretical Perspective on Security and Robustness},
  author = {Zixuan Fu and Yan Ren and Finn Carter and Chenyue Wen and Le Ku and Daheng Yu and Emily Davis and Bo Zhang},
  journal= {arXiv preprint arXiv:2509.12024},
  year   = {2025}
}

备注

updated version