TokenProber:基于细粒度词汇影响分析的文本到图像模型越狱
密码学与安全
2025-05-15 v1 机器学习
摘要
文本到图像(T2I)模型在生成高质量图像方面取得了显著进展。然而,这些模型具有生成包含非适合公众观看(NSFW)内容的图像的能力,如色情、暴力、政治内容及歧视内容。为缓解生成 NSFW 内容的风险,已开发出拒绝机制,即安全检查器,用于检查潜在 NSFW 内容。已开发出对抗性提示技术来评估拒绝机制的鲁棒性。当前的关键挑战在于以微妙方式修改提示,以保持其敏感性同时规避拒绝机制。在本文中,我们引入了 TokenProber,一种用于敏感性感知差异测试的方法,旨�通过生成对抗性提示来评估 T2I 模型拒绝机制的鲁棒性。我们的方法基于这样一个关键观察:对抗性提示往往通过利用 T2I 模型和安全检查器对敏感内容解释之间的差异来成功。因此,我们对提示中特定单词的影响进行细粒度分析,区分生成 NSFW 内容必需的脏词以及高亮不同敏感性评估之间的差异的异议词。通过敏感性感知变异,TokenProber 生成对抗性提示,在保持 NSFW 内容生成和规避检测之间取得平衡。我们对 TokenProber 在 5 个安全检查器和 3 个流行 T2I 模型上的评估显示,其在规避安全过滤器方面优于现有方法(平均提升 54%+),凸显了 TokenProber 揭示现有拒绝机制鲁棒性问题的能力。
引用
@article{arxiv.2505.08804,
title = {TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis},
author = {Longtian Wang and Xiaofei Xie and Tianlin Li and Yuhan Zhi and Chao Shen},
journal= {arXiv preprint arXiv:2505.08804},
year = {2025}
}
备注
13 pages, 5 figures