GuardT2I:防御文本生成图像模型免受对抗性提示攻击
计算机视觉与模式识别
2024-10-31 v2
摘要
近期文本生成图像(T2I)模型的进展引发了对其可能被滥用于生成不适当或非工作场所安全(NSFW)内容的重大安全担忧,尽管现有对策包括 NSFW 分类器或针对不适当概念移除的模型微调。为应对这一挑战,本研究揭示了 GuardT2I,这是一种新颖的审核框架,采用生成式方法增强 T2I 模型对抗对抗性提示的鲁棒性。GuardT2I 不进行二元分类,而是利用大语言模型(LLM)将 T2I 模型内的文本引导嵌入条件性地转换为自然语言,以有效检测对抗性提示,同时不损害模型的固有性能。我们的大量实验表明,在多种对抗场景下,GuardT2I 的表现显著优于 OpenAI-Moderation 和 Microsoft Azure Moderator 等领先的商业解决方案。我们的框架可在 https://github.com/cure-lab/GuardT2I 获取。
引用
@article{arxiv.2403.01446,
title = {GuardT2I: Defending Text-to-Image Models from Adversarial Prompts},
author = {Yijun Yang and Ruiyuan Gao and Xiao Yang and Jianyuan Zhong and Qiang Xu},
journal= {arXiv preprint arXiv:2403.01446},
year = {2024}
}
备注
NeurIPS2024 Poster