面向文本到图像模型的感知引导越狱攻击
计算机视觉与模式识别
2025-02-11 v4
摘要
近年来,文本到图像(T2I)模型因其显著进展而受到广泛关注。然而,由于其生成不当或不宜工作(NSFW)图像的潜力,安全问题随之浮现。本文受不同语义的文本可导致相似人类感知的观察启发,提出了一种由大语言模型驱动的感知引导越狱方法PGJ。这是一种黑盒越狱方法,无需特定的T2I模型(模型无关),并能生成高度自然的攻击提示。具体而言,我们提出识别一个在人类感知上相似但在文本语义上与目标不安全词不一致的安全短语,并将其作为替代使用。在六个开源模型和商业在线服务上使用数千条提示进行的实验验证了PGJ的有效性。
引用
@article{arxiv.2408.10848,
title = {Perception-guided Jailbreak against Text-to-Image Models},
author = {Yihao Huang and Le Liang and Tianlin Li and Xiaojun Jia and Run Wang and Weikai Miao and Geguang Pu and Yang Liu},
journal= {arXiv preprint arXiv:2408.10848},
year = {2025}
}
备注
9 pages, accepted by AAAI 2025