Bi-Erasing:扩散模型中概念移除的双向框架
计算机视觉与模式识别
2025-12-17 v2 密码学与安全
摘要
概念擦除通过对扩散模型进行微调以移除不受欢迎或有害的视觉概念,已成为缓解文本到图像模型中不安全或非法图像生成的主流方法。然而,现有的移除方法通常采用单向擦除策略,要么抑制目标概念,要么强化安全替代方案,这使得在概念移除与生成质量之间难以实现平衡的折衷。为了解决这一局限性,我们提出了一种新颖的双向图像引导概念擦除(Bi-Erasing)框架,该框架同时执行概念抑制和安全增强。具体而言,基于文本提示和相应图像的联合表示,Bi-Erasing 引入了两个解耦的图像分支:一个负责抑制有害语义的负分支,以及一个为安全替代方案提供视觉指导的正分支。通过联合优化这些互补方向,我们的方法在擦除效果和生成可用性之间取得了平衡。此外,我们对图像分支应用基于掩码的过滤,以防止在擦除过程中受到无关内容的干扰。在广泛的实验评估中,所提出的 Bi-Erasing 在平衡概念移除有效性和视觉保真度方面优于基线方法。
引用
@article{arxiv.2512.13039,
title = {Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models},
author = {Hao Chen and Yiwei Wang and Songze Li},
journal= {arXiv preprint arXiv:2512.13039},
year = {2025}
}
备注
Under Review