单神经元即可:文本到图像扩散模型中的精准概念擦除
计算机视觉与模式识别
2025-09-29 v1
摘要
文本到图像模型在图像生成方面展现出惊人的能力,但也带来了生成有害内容的安全风险。现有概念擦除方法的关键挑战是精准移除目标概念,同时最小化图像质量下降。本文提出单神经元概念擦除方法(SNCE),一种仅通过操控单个神经元即可精准防止有害内容生成的新方法。具体而言,我们训练稀疏自编码器(SAE)将文本嵌入映射到稀疏、解耦的潜在空间,其中 individual 神经元与原子语义概念紧密对齐。为准确定位负责有害概念的神经元,我们设计了一种基于激活模式调制频率评分的神经元识别方法。通过抑制有害概念特定神经元的激活,SNCE实现了对概念擦除的外科精准控制,仅对图像质量产生最小干扰。在various基准测试中,实验表明SNCE在目标概念擦除方面实现了最先进的效果,同时保留了对非目标概念的生成能力。此外,该方法对对抗性攻击具有强大的鲁棒性,显著优于现有方法。
引用
@article{arxiv.2509.21008,
title = {A Single Neuron Works: Precise Concept Erasure in Text-to-Image Diffusion Models},
author = {Qinqin He and Jiaqi Weng and Jialing Tao and Hui Xue},
journal= {arXiv preprint arXiv:2509.21008},
year = {2025}
}