$PC^2$:通过对基于 GPT 的文本到图像模型进行越狱攻击生成政治争议内容
密码学与安全
2026-01-16 v2
摘要
文本到图像 (T2I) 模型的快速发展在全球范围内实现了高保真视觉合成。然而,这些进步也带来了重大的安全风险,特别是在有害内容生成方面。政治有害内容(例如对公众人物的捏造描绘)一旦被用于假新闻或政治宣传,将构成严重威胁。尽管其至关重要,但当前 T2I 安全过滤器对此类出于政治动机的对抗性提示的鲁棒性仍未得到充分探索。作为回应,我们提出了 ,这是首个针对 T2I 模型的黑盒政治越狱框架。它利用了一个新漏洞:安全过滤器基于语言语境来评估政治敏感性。 的运行方式包括:(1) 保持身份的描述性映射,将敏感关键词混淆为中性描述;(2) 地缘政治远距翻译,将这些描述映射为碎片化、低敏感度的语言。该策略阻止了过滤器在提示内构建政治实体间的有害关联,从而有效绕过检测。我们构建了一个包含 240 个涉及 36 位公众人物的政治敏感提示的基准。在商业 T2I 模型(特别是 GPT 系列)上的评估表明,虽然所有原始提示均被拦截,但 的攻击成功率高达 86%。
引用
@article{arxiv.2601.05150,
title = {$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models},
author = {Wonwoo Choi and Minjae Seo and Minkyoo Song and Hwanjo Heo and Seungwon Shin and Myoungsung You},
journal= {arXiv preprint arXiv:2601.05150},
year = {2026}
}
备注
19 pages, 15 figures, 9 tables