原型引导的扩散模型概念擦除
计算机视觉与模式识别
2026-03-10 v1
摘要
概念擦除在图像生成中被广泛用于防止文本到图像模型生成不希望的内容。现有方法能够有效擦除特定且具体的狭义概念,如具有辨识度的知识产权(如皮卡卡)或可识别人物(如埃隆·马克克)等。然而,这些方法在擦除广泛概念(如“性”或“暴力”)时性能下降,因为其广泛的范围和多面性使其难以可靠地被擦除。为克服这一限制,我们利用模型内在的嵌入几何结构来识别编码给定概念的潜在嵌入。通过聚类这些嵌入,我们导出一组概念原型,用以总结模型对该概念的内部表示,并在推理时充当负条件信号,以实现精确可靠的擦除。跨多个基准的大量实验表明,我们的方法在擦除广泛概念方面显著优于现有方法,同时保持整体图像质量,标志着向更安全更可控的图像生成迈出了一步。
引用
@article{arxiv.2603.08271,
title = {Prototype-Guided Concept Erasure in Diffusion Models},
author = {Yuze Cai and Jiahao Lu and Hongxiang Shi and Yichao Zhou and Hong Lu},
journal= {arXiv preprint arXiv:2603.08271},
year = {2026}
}
备注
Accepted by CVPR 2026