AdvAnchor:基于对抗锚点的增强扩散模型遗忘技术
机器学习
2025-01-03 v1 人工智能
计算与语言
摘要
围绕文本到图像扩散模型的安全问题,研究者们通过微调以遗忘不当概念。近期的微调方法通常通过与预定义文本锚点对齐预测分布来实现,但这些技术在消除不当概念与保留其他概念之间表现出显著的性能权衡。本文系统性分析了不同文本锚点对遗忘性能的影响。基于该分析,我们提出AdvAnchor,一种新型方法生成对抗锚点以缓解此权衡问题。这些对抗锚点被设计为紧致地模拟不当概念的嵌入,以维持整体模型性能,同时选择性地排除这些概念的关键属性,以实现有效擦除。大量实验表明,AdvAnchor在性能上优于当前最先进的方法。我们的代码已公开于https://anonymous.4open.science/r/AdvAnchor。
引用
@article{arxiv.2501.00054,
title = {AdvAnchor: Enhancing Diffusion Model Unlearning with Adversarial Anchors},
author = {Mengnan Zhao and Lihe Zhang and Xingyi Yang and Tianhang Zheng and Baocai Yin},
journal= {arXiv preprint arXiv:2501.00054},
year = {2025}
}