中文

基于高层表示误导的文本到图像扩散模型中的局部概念擦除

计算机视觉与模式识别 2026-02-24 v1 人工智能

摘要

最近的文本到图像(text-to-image,T2I)扩散模型取得了快速广泛的应用。然而,这些强大的生成能力引发了担忧:可能被用于合成有害、私人或受版权保护的内容。为缓解此类风险,概念擦除技术已成为有前景的解决方案。以往的工作主要聚焦于微调去噪组件(如U-Net主干网络)。然而,最近的因果追踪研究表明,视觉属性信息局部化于文本编码器的早期自注意力层,这表明存在另一种可用于概念擦除的途径。基于这一洞察,我们进行初步实验,发现直接微调早期层可抑制目标概念,但常常会损害非目标概念的生成质量。为克服这一限制,我们提出了高层表示误导(High-Level Representation Misdirection,HiRM)方法,通过将目标概念的高层语义表示误导至指定向量(如随机方向或语义定义的方向,如超类),同时仅更新包含视觉属性因果状态的早期层。我们的解耦策略使精准移除概念成为可能,且对无关概念的影响最小。我们在UnlearnCanvas和NSFW基准测试中进行了强有力的验证,涵盖多种目标(如对象、风格、裸露内容)。HiRM还保留了低训练成本下的生成效用,能无需额外训练地迁移至如Flux等最新架构,并且与去噪器基础概念擦除方法存在协同效应。

关键词

引用

@article{arxiv.2602.19631,
  title  = {Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection},
  author = {Uichan Lee and Jeonghyeon Kim and Sangheum Hwang},
  journal= {arXiv preprint arXiv:2602.19631},
  year   = {2026}
}

备注

Accepted at ICLR 2026. The first two authors contributed equally