中文

用于安全文本到图像生成的通用提示优化器

计算机视觉与模式识别 2024-12-13 v6 计算与语言

摘要

文本到图像 (T2I) 模型在基于文本提示生成图像方面表现出色。然而,这些模型容易受到不安全输入的影响,从而生成色情、骚扰和非法活动等不安全内容的图像。现有的基于图像检查器、模型微调和嵌入阻断的研究在实际应用中并不切实际。因此,我们提出了首个用于黑盒场景下安全 T2I (POSI) 生成的通用提示优化器。我们首先利用 GPT-3.5 Turbo 构建了一个由有毒 - 清洁提示对组成的数据集。为了引导优化器具备将有毒提示转换为清洁提示同时保留语义信息的能力,我们设计了一种新的奖励函数来衡量生成图像的毒性和文本对齐度,并通过近端策略优化 (Proximal Policy Optimization) 训练优化器。实验表明,我们的方法能有效降低各种 T2I 模型生成不适当图像的可能性,且对文本对齐度无显著影响。该方法还具有良好的灵活性,可与其他方法结合以实现更好的性能。我们的代码可在 https://github.com/wu-zongyu/POSI 获取。

关键词

引用

@article{arxiv.2402.10882,
  title  = {Universal Prompt Optimizer for Safe Text-to-Image Generation},
  author = {Zongyu Wu and Hongcheng Gao and Yueze Wang and Xiang Zhang and Suhang Wang},
  journal= {arXiv preprint arXiv:2402.10882},
  year   = {2024}
}