中文

面向抵御下游微调的扩散模型鲁棒安全驱动遗忘

机器学习 2025-12-09 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

文本到图像(T2I)扩散模型已实现了令人印象深刻的图像生成质量,并越来越多地通过微调用于个性化应用。然而,这些模型常常从有毒的预训练数据中继承不安全行为,引发了日益增长的安全担忧。尽管近期安全驱动的遗忘方法在抑制模型毒性方面取得了可喜进展,但它们被发现对下游微调十分脆弱,正如我们所揭示的,即使仅在完全良性的数据集上进行微调,最先进的方法在很大程度上也无法保持其有效性。为缓解此问题,本文提出 ResAlign,一种增强了抵御下游微调鲁棒性的安全驱动遗忘框架。通过将下游微调建模为基于 Moreau 包络重构的隐式优化问题,ResAlign 能够进行高效的梯度估计,以最小化有害行为的恢复。此外,提出了一种元学习策略来模拟多样化的微调场景分布,以提升泛化能力。在广泛的数据集、微调方法和配置上的大量实验表明,ResAlign 在保持安全性方面始终优于先前的遗忘方法,同时有效保留了良性生成能力。我们的代码和预训练模型公开于 https://github.com/AntigoneRandy/ResAlign。

关键词

引用

@article{arxiv.2507.16302,
  title  = {Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning},
  author = {Boheng Li and Renjie Gu and Junjie Wang and Leyi Qi and Yiming Li and Run Wang and Zhan Qin and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2507.16302},
  year   = {2025}
}

备注

Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)