中文

安全文本生成图像:仅需净化提示词嵌入

密码学与安全 2025-04-16 v2 人工智能 计算与语言

摘要

近年来,文本生成图像(T2I)模型在生成与文本描述相符的高质量图像方面取得了显著进展。然而,这些模型也面临不安全生成的风险,可能产生违反使用政策的有害内容(如露骨材料)。现有的安全生成方法通常侧重于通过从视觉表征中抹除不需要的概念来抑制不当内容,而忽视了对文本表征的净化。尽管这些方法在一定程度上缓解了滥用风险,但其鲁棒性在面对对抗攻击时仍显不足。鉴于输入文本与输出图像之间的语义一致性是 T2I 模型的核心要求,我们认定文本表征极有可能是不安全生成的主要来源。为此,我们提出了嵌入净化器(ES),通过净化提示词嵌入中的不当概念来增强 T2I 模型的安全性。据我们所知,ES 是首个可解释的安全生成框架,它为提示词中的每个标记分配一个分数以指示其潜在有害性。此外,ES 采用即插即用的模块化设计,可无缝集成到各种 T2I 模型和其他防护措施中。在五个提示词基准上的评估显示,ES 优于十一个现有的防护基线,在保持高质量图像生成的同时实现了最先进的鲁棒性。

关键词

引用

@article{arxiv.2411.10329,
  title  = {Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding},
  author = {Huming Qiu and Guanxu Chen and Mi Zhang and Xiaohan Zhang and Xiaoyu You and Min Yang},
  journal= {arXiv preprint arXiv:2411.10329},
  year   = {2025}
}