SteerDiff: 引导安全文本到图像扩散模型
计算机视觉与模式识别
2025-10-07 v2 人工智能
密码学与安全
摘要
文本到图像(T2I)扩散模型因能够生成与文本精确对齐的高质量图像而受到关注。然而,这些模型也可能被用于生成不适当内容。现有安全措施(通常依赖文本分类器或 ControlNet 类方法)往往不足。传统文本分类器依赖大规模标记数据集,且易被重新表述所规避。随着扩散模型的规模不断扩大,对这些安全措施的微调日益困难且缺乏灵活性。近期的红队攻击研究进一步凸显了需要新范式来防止生成不适当内容的需求。本文引入 SteerDiff,一种轻量级适配器模块,作为用户输入与扩散模型之间的中介,确保生成的图像遵守伦理和安全标准,同时几乎不影响可用性。SteerDiff 在文本嵌入空间中识别并操纵不恰当概念,以引导模型远离有害输出。我们在各种概念遗忘任务上进行了广泛实验,以评估方法的有效性。此外,我们将 SteerDiff 与多种红队策略进行基准测试,以评估其鲁棒性。最后,我们探讨了 SteerDiff 在概念遗忘任务中的潜力,展示了其在文本条件图像生成中的多样性。
引用
@article{arxiv.2410.02710,
title = {SteerDiff: Steering towards Safe Text-to-Image Diffusion Models},
author = {Hongxiang Zhang and Yifeng He and Hao Chen},
journal= {arXiv preprint arXiv:2410.02710},
year = {2025}
}