中文

ActErase:通过激活重定向实现精确概念擦除的无训练范式

计算机视觉与模式识别 2026-04-02 v2

摘要

最近的文本到图像扩散模型进展显示出惊人的生成能力,但也引发了关于安全、版权和伦理影响的广泛关注。现有的概念擦除方法通过从预训练模型中移除敏感概念来解决这些风险,但大多数方法依赖数据密集且计算昂贵的微调,构成了关键限制。为克服这些挑战,我们受到观察到模型激活主要由通用概念组成,仅有极小部分可表示目标概念的启发,提出一种新颖的无训练方法(ActErase)用于高效概念擦除。具体而言,所提方法通过prompt对分析识别激活差异区域,提取目标激活并在前向传递期间动态替换输入激活。对三项关键擦除任务(裸露、艺术风格和物体移除)进行的全面评估表明,我们的无训练方法实现了最先进(SOTA)擦除性能,同时有效保留了模型的整体生成能力。我们的方法还对对抗攻击表现出强大的鲁棒性,确立了一个轻量且高效的概念操纵扩散模型的即插即用范式。

关键词

引用

@article{arxiv.2601.00267,
  title  = {ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Redirection},
  author = {Yi Sun and Xinhao Zhong and Hongyan Li and Yimin Zhou and Junhao Li and Bin Chen and Xuan Wang},
  journal= {arXiv preprint arXiv:2601.00267},
  year   = {2026}
}