中文

AutoPrompt:基于 LLM 驱动的文本到图像模型自动化对抗提示生成

计算机视觉与模式识别 2025-10-29 v1

摘要

尽管文本到图像(T2I)模型在快速发展,但其安全机制仍易受对抗性提示攻击,导致生成不安全图像。当前用于主动评估此类漏洞的红队测试方法通常需要对 T2I 模型拥有白盒访问权限,且依赖低效的逐提示优化,同时不可避免地生成语义无意义的提示,容易被过滤器屏蔽。本文提出了 APT(AutoPrompT),一个基于大语言模型(LLM)自动生成对人类友好型对抗后缀的黑盒框架。我们首先引入了一种在对抗后缀优化与利用优化后缀微调 LLM 之间的交替优化-微调管道。进一步地,我们在优化阶段集成了双重规避策略,使其能够绕过基于困惑度的过滤器和黑名单词过滤器:(1)我们通过辅助 LLM 困惑度评分,对 LLM 生成的人类友好型提示进行约束,这与先前基于 token 级别的胡言乱语截然不同;(2)我们还引入了已禁词惩罚,以抑制黑名单中显式生成禁用词的行为。大量实验表明,我们的人类友好型、抗过滤器对抗提示在红队测试中表现卓越,同时具备优异的零样本迁移能力,能够即时适应未见过的提示,并暴露出即使在商业 API(如 Leonardo.Ai)中也存在的关键漏洞。

关键词

引用

@article{arxiv.2510.24034,
  title  = {AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts},
  author = {Yufan Liu and Wanqian Zhang and Huashan Chen and Lin Wang and Xiaojun Jia and Zheng Lin and Weiping Wang},
  journal= {arXiv preprint arXiv:2510.24034},
  year   = {2025}
}

备注

Accepted by ICCV 2025