CE-SDWV:基于语义驱动词汇的文本到图像扩散模型高效概念擦除方法
计算机视觉与模式识别
2025-10-01 v2 人工智能
摘要
大规模文本到图像(T2I)扩散模型在 various concepts 上取得了显著的生成性能。然而,受隐私和安全实践限制,关于 NSFW(Not Safe For Work)概念的生成能力不可取,例如生成包含情色内容的照片和受版权保护的图像。文本到图像扩散模型的概念擦除任务已引起广泛关注,需提出有效且高效的方法。为实现此目标,我们提出了 CE-SDWV 框架,通过仅调整文本条件 token 即可在文本语义空间中移除 T2I 扩散模型的目标概念(例如 NSFW 概念),无需重新训练原始 T2I 扩散模型的权重。具体而言,本框架首先构建与目标概念相关的词汇表,以增强文本语义空间中目标概念的表征,然后利用自适应语义组件抑制策略来消除文本条件 token 中的目标概念相关语义信息。为进一步将上述文本条件 token 适配到原始图像语义空间,我们提出了端到端梯度正交 token 优化策略。在 I2P 和 UnlearnCanvas 数据集上的大量实验表明,我们的方法在有效性和效率方面均表现优异。代码已公开于 https://github.com/TtuHamg/CE-SDWV。
引用
@article{arxiv.2501.15562,
title = {CE-SDWV: Effective and Efficient Concept Erasure for Text-to-Image Diffusion Models via a Semantic-Driven Word Vocabulary},
author = {Jiahang Tu and Qian Feng and Jiahua Dong and Hanbin Zhao and Chao Zhang and Nicu Sebe and Hui Qian},
journal= {arXiv preprint arXiv:2501.15562},
year = {2025}
}
备注
25 pages, 14 figures