中文

PromptGuard:面向文本到图像模型的软提示引导的不安全内容 Moderation

计算机视觉与模式识别 2026-05-12 v5 人工智能 密码学与安全

摘要

近期文本到图像(T2I)模型在生成高质量图像方面表现突出,但这些模型易被滥用,尤其是生成不适合 work(NSFW)内容,如性暗示、暴力、政治及令人不适的图像,引发严重伦理争议。本文提出PromptGuard,一种新型内容 moderation 技术,借鉴大语言模型(LLM)中用于安全对齐的系统提示机制。不同于LLM,T2I模型缺乏直接强制行为准则的接口。我们的核心思想是优化一个安全软提示,作为T2I模型文本嵌入空间中的隐式系统提示。该通用软提示(P*)直接调控NSFW输入,实现安全且逼真的图像生成,无需影响推理效率或依赖代理模型。我们进一步通过采用分治策略优化类别特定软提示并将其整合为统一安全指导,提升其可靠性和实用性。跨五个数据集的广泛实验表明,PromptGuard有效缓解了NSFW内容生成,同时保持高质量的良性输出。PromptGuard比现有内容 moderation 方法快3.8倍,同时超越八种最先进的防御方法。使用多头安全分类器和VLM-based guardrail进行评估,结果表明其稳健性,分别平均不安全比率为5.84%和6.18%。我们的代码和数据集已公开于 https://t2i-promptguard.github.io/。

关键词

引用

@article{arxiv.2501.03544,
  title  = {PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models},
  author = {Lingzhi Yuan and Xinfeng Li and Chejian Xu and Guanhong Tao and Xiaojun Jia and Yihao Huang and Wei Dong and Yang Liu and Bo Li},
  journal= {arXiv preprint arXiv:2501.03544},
  year   = {2026}
}

备注

Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)