TRCE:面向文本到图像扩散模型中可靠恶意概念擦除
计算机视觉与模式识别
2025-10-07 v2 人工智能
摘要
文本到图像扩散模型的最新进展实现了逼真的图像生成,但也存在产生恶意内容(如 NSFW 图像)的风险。为了降低风险,研究者们研究了概念擦除方法,以促进模型遗忘特定概念。然而,当前的研究难以在完全擦除隐式嵌入在提示词中的恶意概念(例如,隐喻表达或对抗性提示)的同时,保留模型的正常生成能力。为了应对这一挑战,我们的研究提出了 TRCE,使用两阶段概念擦除策略在可靠擦除与知识保留之间实现有效权衡。首先,TRCE 从擦除文本提示中隐式嵌入的恶意语义开始。通过识别一个关键映射目标(即 [EoT] 嵌入),我们优化交叉注意力层,将恶意提示映射到上下文相似但具有安全概念的提示。此步骤防止模型在去噪过程中过度受恶意语义的影响。随后,考虑到扩散模型采样轨迹的确定性属性,TRCE 进一步通过对比学习引导早期去噪预测走向安全方向并远离不安全方向,从而进一步避免恶意内容的生成。最后,我们在多个恶意概念擦除基准上对 TRCE 进行了全面评估,结果表明其在擦除恶意概念的同时能更好地保留模型的原始生成能力。代码获取地址:http://github.com/ddgoodgood/TRCE。注意:本文包含可能具有冒犯性的模型生成内容。
引用
@article{arxiv.2503.07389,
title = {TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models},
author = {Ruidong Chen and Honglin Guo and Lanjun Wang and Chenyu Zhang and Weizhi Nie and An-An Liu},
journal= {arXiv preprint arXiv:2503.07389},
year = {2025}
}
备注
accepted by ICCV2025