中文

通过渐进对齐实现零残差概念抹除:基于文本到图像模型

计算机视觉与模式识别 2025-08-07 v1 人工智能 机器学习

摘要

概念抹除旨在防止预训练的文本到图像模型生成与语义有害概念(即目标概念)相关的内容,正受到日益关注的注意。当前方法将此任务 formulated 为一个优化问题:它们将所有目标概念与语义无害锚概念对齐,并应用闭式解来更新模型。虽然这些闭式方法高效,但我们认为现有方法存在两个被忽视的局限性:1)它们常导致因“非零对齐残差”而实现不完全抹除,尤其在文本提示相对复杂时;2)它们可能因始终将参数更新集中在少数深层而导致生成质量下降。为此,我们提出了一种新型闭式方法 ErasePro:其设计旨在实现更完整的概念抹除并更好地保留整体生成质量。具体而言,ErasePro 首先在优化目标中引入严格的零残差约束,确保目标与锚概念特征之间的完美对齐,从而实现更完整的抹除。其次,它采用渐进的、层级的更新策略,从浅层到深层层次逐步将目标概念特征转移到锚概念特征。随着深度的增加,所需的参数变化减小,从而减少对敏感深层的偏差并保留生成质量。经实证研究表明,在包括实例、艺术风格和裸露抹除等不同概念抹除任务中,ErasePro 的效果显著。

关键词

引用

@article{arxiv.2508.04472,
  title  = {Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model},
  author = {Hongxu Chen and Zhen Wang and Taoran Mei and Lin Li and Bowei Zhu and Runshi Li and Long Chen},
  journal= {arXiv preprint arXiv:2508.04472},
  year   = {2025}
}