从扩散模型中擦除概念的副作用
机器学习
2025-09-23 v3 计算机视觉与模式识别
摘要
对文本到图像(T2I)生成模型侵犯隐私、版权和安全的担忧,推动了概念擦除技术(CETs)的发展。一个有效的 CET 的目标是禁止生成用户指定的非期望“目标”概念,同时保持合成其他概念高质量图像的能力。在这项工作中,我们证明了概念擦除存在副作用,并且 CETs 可以被轻易绕过。为了全面衡量 CETs 的鲁棒性,我们提出了副作用评估(SEE)基准,该基准由描述对象及其属性的层次化和组合式提示组成。该数据集和一个自动化评估流程从三个方面量化了 CETs 的副作用:对邻近概念的影响、目标的规避以及属性泄漏。我们的实验表明,通过使用超类-子类层次结构、语义相似的提示以及目标的组合变体,可以绕过 CETs。我们表明,CETs 存在属性泄漏以及一种注意力集中或分散的反直觉现象。我们发布了我们的基准和评估工具,以帮助未来关于鲁棒概念擦除的研究。
引用
@article{arxiv.2508.15124,
title = {Side Effects of Erasing Concepts from Diffusion Models},
author = {Shaswati Saha and Sourajit Saha and Manas Gaur and Tejas Gokhale},
journal= {arXiv preprint arXiv:2508.15124},
year = {2025}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2025