中文

被擦除还是潜伏?重新思考概念擦除的可逆性

计算机视觉与模式识别 2025-09-19 v2

摘要

概念擦除在多大程度上会消除扩散模型的生成能力?虽然先前的评估主要关注在特定文本提示下衡量概念抑制,但我们探索了一个互补且根本的问题:当前概念擦除技术是否真正消除了生成目标概念的能力,还是仅实现了基于特定提示的表面抑制?我们系统评估了两种代表性概念擦除方法——统一概念编辑(Unified Concept Editing)和被擦除的稳定扩散(Erased Stable Diffusion)的鲁棒性和可逆性,通过探针测试其消除文本到图像模型中目标生成行为的能力。这些方法试图通过修改内部模型参数来抑制不希望的语义概念,无论是通过针对性注意力编辑还是模型级微调策略。为了严格评估这些技术是否真正消除生成能力,我们提出了一种实例级评估策略,采用轻量级微调来显式测试被擦除概念的再激活潜力。通过量化指标和定性分析,我们显示,被擦除的概念在最小适应后常常以相当高的视觉保真度重新出现,表明当前方法仅在抑制潜在生成表示而不完全消除它们。我们的发现揭示了现有概念擦除方法的关键局限性,并强调需要更深入的、基于表示层面的干预以及更严格的评估标准,以确保从生成模型中真正、不可逆地移除概念。

关键词

引用

@article{arxiv.2505.16174,
  title  = {Erased or Dormant? Rethinking Concept Erasure Through Reversibility},
  author = {Ping Liu and Chi Zhang},
  journal= {arXiv preprint arXiv:2505.16174},
  year   = {2025}
}

备注

Dr. Chi Zhang is the corresponding author