通过文本条件扩散模型中的嵌入扰动缓解异性内容生成
计算机视觉与模式识别
2025-11-11 v2 密码学与安全
机器学习
摘要
扩散模型在跟随文本提示生成图像方面表现突出,但存在生成异性内容的风险。现有方法,如提示过滤、概念删除甚至异性内容缓解方法,难以在保持良好图像质量的同时抵御对抗性攻击。本文提出了一种新方法,称为Distorting Embedding Space(DES),这是一种基于文本编码器的防御机制,通过创新的嵌入空间控制有效应对这些问题。DES将从不安全提示中提取的不安全嵌入转化为指向精心计算的安全嵌入区域,以防止不安全内容的生成,同时再现原始的安全嵌入。DES还通过将其与中性嵌入对齐来中和“裸露”嵌入,以增强对对抗性攻击的鲁棒性。结果,大量实验在显性内容缓解和自适应攻击防御方面表明,DES实现了状态的最佳(SOTA)防御,在FLUX.1上攻击成功率(ASR)为9.47%,在广泛采用的Stable Diffusion v1.5上为0.52%。这分别对应于相对于之前的SOTA方法(EraseAnything和AdvUnlearn)的ASR降低76.5%和63.9%。此外,DES保持良好的图像质量,实现的Fid inception distance和CLIP分数与原始FLUX.1和Stable Diffusion v1.5相当。
引用
@article{arxiv.2501.18877,
title = {Mitigating Sexual Content Generation via Embedding Distortion in Text-conditioned Diffusion Models},
author = {Jaesin Ahn and Heechul Jung},
journal= {arXiv preprint arXiv:2501.18877},
year = {2025}
}
备注
NeurIPS 2025 accepted. Official code: https://github.com/amoeba04/des