FADE:面向扩散模型的对抗性概念擦除
计算机视觉与模式识别
2025-07-17 v1
摘要
扩散模型已展现出卓越的图像生成能力,但也因记忆敏感概念或延续偏见而带来隐私和公平性风险。我们提出一种新颖的概念擦除方法,用于从文本到图像扩散模型中移除指定概念(如私人个体或有害刻板印象)。我们的方法称为 FADE(Fair Adversarial Diffusion Erasure),结合轨迹感知的微调策略与对抗目标,确保可靠移除概念的同时保持模型整体保真度。理论上,我们形式化地证明了该方法可最小化被擦除概念与模型输出之间的互信息,从而确保隐私和公平性。实验上,我们在 Stable Diffusion 和 FLUX 上进行评估,使用来自 prior work 的基准(如对象、明星、隐晦内容及风格擦除任务来自 MACE)。FADE 在概念移除性能和图像质量方面均达到最先进水平,超越了 ESD、UCE、MACE 和 ANT 等近期基线方法。值得注意的是,FADE 在概念移除与保真度的调和指数上比最佳 prior 方法提高了5%-10%。我们还进行了消融研究,以验证 FADE 的各个组件,确认其对抗目标和轨迹保持目标各自对其卓越性能都有贡献。我们的工作为在不从头重新训练的情况下对指定概念进行遗忘,制定了更安全更公平的生成模型新标准。
引用
@article{arxiv.2507.12283,
title = {FADE: Adversarial Concept Erasure in Flow Models},
author = {Zixuan Fu and Yan Ren and Finn Carter and Chenyue Wang and Ze Niu and Dacheng Yu and Emily Davis and Bo Zhang},
journal= {arXiv preprint arXiv:2507.12283},
year = {2025}
}
备注
Camera Ready