中文

SafeGuider:面向文本到图像模型的稳健实用内容安全控制

密码学与安全 2025-10-16 v3 人工智能 计算机视觉与模式识别

摘要

文本到图像模型在生成高质量图像方面展现出惊人的能力,但这些模型对对抗性提示词高度脆弱,后者可绕过安全措施并生成有害内容。尽管已有各种防御策略,但在实际应用中实现对攻击的鲁棒性同时保持实用性仍是一个重大挑战。为此,我们首先对 Stable Diffusion(SD)模型中的文本编码器进行实证研究——该模型广泛使用且具有代表性。我们的发现表明,[EOS] 标记充当语义聚合器,在其嵌入空间中呈现出良性提示词与对抗性提示词之间的不同分布模式。基于此洞见,我们引入 SafeGuider,一个两步框架,用于稳健的安全控制且不损害生成质量。SafeGuider 结合了嵌入级别的识别模型和面向安全的特征擦除束搜索算法。该集成使框架能够为良性提示词维持高质量图像生成,同时确保对内域和外域攻击的稳健防御。SafeGuider 在各种攻击情景下均表现出卓越的效果,最大攻击成功率仅为 5.48%。此外,SafeGuider 不会因拒绝生成或输出黑色图像而对不安全提示词作出回应,而是生成安全且有意义的图像,从而提升了实际应用价值。SafeGuider 不局限于 SD 模型,也可有效应用于其他文本到图像模型(如 Flux 模型),展现出在不同架构下的广泛适用性和可适应性。我们希望 SafeGuider 能为安全可靠的文本到图像系统的实际部署提供一些参考。

关键词

引用

@article{arxiv.2510.05173,
  title  = {SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models},
  author = {Peigui Qi and Kunsheng Tang and Wenbo Zhou and Weiming Zhang and Nenghai Yu and Tianwei Zhang and Qing Guo and Jie Zhang},
  journal= {arXiv preprint arXiv:2510.05173},
  year   = {2025}
}

备注

Accepted by ACM CCS 2025, Code is available at [this https URL](https://github.com/pgqihere/safeguider)