针对文本生成图像模型的多模态语用越狱
计算机视觉与模式识别
2025-06-12 v2 人工智能
密码学与安全
机器学习
摘要
扩散模型近期在图像质量和与文本提示的保真度方面取得了显著进展。与此同时,此类生成模型的安全性已成为日益受到关注的领域。本工作引入了一种新型越狱,它触发T2I模型生成带有视觉文本的图像,其中图像和文本虽然孤立来看是安全的,但结合起来却构成了不安全内容。为了系统地探索这一现象,我们提出了一个数据集,以评估当前基于扩散的文本生成图像(T2I)模型在此类越狱下的表现。我们对九个具有代表性的T2I模型进行了基准测试,包括两个闭源商业模型。实验结果揭示了产生不安全内容的令人担忧的趋势:所有测试的模型都遭受此类越狱,不安全生成的比例从约10%到70%不等,其中DALLE 3表现出几乎最高的不安全性。在真实场景中,通常采用各种过滤器(如关键词黑名单、定制提示过滤器和NSFW图像过滤器)来减轻这些风险。我们评估了此类过滤器对我们越狱的有效性,发现虽然这些过滤器对于单模态检测可能有效,但它们无法抵御我们的越狱。我们还从文本渲染能力和训练数据的角度调查了此类越狱的潜在原因。我们的工作为进一步开发更安全、更可靠的T2I模型奠定了基础。项目页面位于 https://multimodalpragmatic.github.io/。
引用
@article{arxiv.2409.19149,
title = {Multimodal Pragmatic Jailbreak on Text-to-image Models},
author = {Tong Liu and Zhixin Lai and Jiawen Wang and Gengyuan Zhang and Shuo Chen and Philip Torr and Vera Demberg and Volker Tresp and Jindong Gu},
journal= {arXiv preprint arXiv:2409.19149},
year = {2025}
}