STEREO:一种针对文本到图像扩散模型对抗鲁棒概念擦除的两阶段框架
计算机视觉与模式识别
2025-04-03 v2
摘要
大规模文本到图像扩散(T2ID)模型的快速普及引发了对其被滥用于生成有害内容的严重担忧。尽管已有许多方法被提出用于从 T2ID 模型中擦除不良概念,但它们往往提供一种虚假的安全感;概念擦除模型(CEM)仍可通过对抗攻击被操纵以重新生成被擦除的概念。虽然近期出现了少数基于对抗训练的鲁棒概念擦除方法,但它们为了实现鲁棒性而牺牲了效用(良性概念的生成质量),且/或仍易受高级嵌入空间攻击的影响。这些局限性源于鲁棒 CEM 未能彻底搜索嵌入空间中的“盲点”。为弥补这一差距,我们提出了 STEREO,一种新颖的两阶段框架,其将对抗训练作为实现鲁棒概念擦除的第一步而非唯一步骤。在第一阶段,STEREO 采用对抗训练作为漏洞识别机制以进行充分搜索。在第二阶段的单次鲁棒擦除阶段,STEREO 引入基于锚点概念的组合目标,在单次微调阶段中鲁棒地擦除目标概念,同时最小化模型效用的退化。我们将 STEREO 与七种最先进的概念擦除方法进行了基准测试,证明其对白盒和黑盒攻击均具有卓越的鲁棒性,同时大幅保留了效用。
引用
@article{arxiv.2408.16807,
title = {STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion Models},
author = {Koushik Srivatsan and Fahad Shamshad and Muzammal Naseer and Vishal M. Patel and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2408.16807},
year = {2025}
}
备注
Accepted to CVPR-2025. Code: https://github.com/koushiksrivats/robust-concept-erasing