中文

GIFT:面向扩散模型的梯度感知免疫方法,抵御恶意微调并保留安全概念

密码学与安全 2025-07-21 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

我们提出了GIFT:一种梯度感知免疫技术,用于防御扩散模型免受恶意微调,同时保留其生成安全内容的能力。现有的安全机制(如安全检查器)很容易被绕过,而概念擦除方法在对抗性微调下也会失效。GIFT通过将免疫问题表述为一个双层优化问题来解决这个问题:上层目标通过表示噪声化和最大化来降低模型表示有害概念的能力,而下层目标则保留在安全数据上的性能。GIFT在保持安全生成质量的同时,实现了对恶意微调的鲁棒抵抗。实验结果表明,我们的方法显著削弱了模型重新学习有害概念的能力,同时保持了在安全内容上的性能,为创建本质上更安全、能够抵御对抗性微调攻击的生成模型提供了一个有前景的方向。

关键词

引用

@article{arxiv.2507.13598,
  title  = {GIFT: Gradient-aware Immunization of diffusion models against malicious Fine-Tuning with safe concepts retention},
  author = {Amro Abdalla and Ismail Shaheen and Dan DeGenaro and Rupayan Mallick and Bogdan Raita and Sarah Adel Bargal},
  journal= {arXiv preprint arXiv:2507.13598},
  year   = {2025}
}

备注

Warning: This paper contains NSFW content. Reader discretion is advised