中文

基于概念层级的扩散模型大规模概念抹除

计算机视觉与模式识别 2026-01-08 v1 人工智能 计算机与社会

摘要

扩散模型的成功引发了关于生成不安全或有害内容的担忧,促使出现概念抹除方法,通过微调模块来抑制特定概念,同时保持一般生成能力。然而,随着被抹除概念数量的增加,这些方法常变得效率低且效果不佳,因为每个概念都需要一套独立的微调参数,可能降低整体生成质量。本文提出一种 supertype-subtype 概念层级,将被抹除概念组织为父子节点结构。每个被抹除概念作为子节点,语义上相关的概念(如鹦鹉、秃鹰)归属于共享的父节点,即 supertype 概念(如鸟)。不以单个概念独立抹除,而是引入一种高效且有效的 group-wise suppression 方法,对语义相似的概念进行分组性抹除,同时共享单一套可学习参数。在抹除阶段,应用标准扩散正则化以保持 unmasked 区域的去噪过程。为缓解因过度抹除语义相关子类型而导致的 supertype 生成性能下降,我们提出一种新方法——Supertype-Preserving Low-Rank Adaptation (SuPLoRA),其将 supertype 概念信息编码于冻结的 down-projection 矩阵中,仅更新 up-projection 矩阵。在理论分析中,我们证明了 SuPLoRA 在缓解生成性能降低方面的有效性。我们构建了一个更具挑战性的基准,要求同时抹除跨 diverse 领域的概念,包括明星、物体和色情内容。

关键词

引用

@article{arxiv.2601.03305,
  title  = {Mass Concept Erasure in Diffusion Models with Concept Hierarchy},
  author = {Jiahang Tu and Ye Li and Yiming Wu and Hanbin Zhao and Chao Zhang and Hui Qian},
  journal= {arXiv preprint arXiv:2601.03305},
  year   = {2026}
}

备注

This paper has been accepted by AAAI 2026