Groot:基于树状语义变换的生成式文本到图像模型对抗测试
计算与语言
2024-02-20 v1 人工智能
密码学与安全
软件工程
摘要
随着文本到图像生成模型的普及,其安全性成为一个关键问题。对抗测试技术已被开发用于探测此类模型是否会被提示生成不适合工作场所(NSFW)的内容。然而,现有解决方案面临若干挑战,包括成功率低和效率低下。我们推出了 Groot,这是首个利用基于树状语义变换进行文本到图像模型对抗测试的自动化框架。Groot 结合大语言模型(LLMs),采用语义分解和敏感元素淹没策略来系统地优化对抗性提示。我们的综合评估证实了 Groot 的有效性,它不仅超越了当前最先进方法的性能,而且在 DALL-E 3 和 Midjourney 等领先的文本到图像模型上取得了显著的成功率(93.66%)。
引用
@article{arxiv.2402.12100,
title = {Groot: Adversarial Testing for Generative Text-to-Image Models with Tree-based Semantic Transformation},
author = {Yi Liu and Guowei Yang and Gelei Deng and Feiyue Chen and Yuqi Chen and Ling Shi and Tianwei Zhang and Yang Liu},
journal= {arXiv preprint arXiv:2402.12100},
year = {2024}
}