Arondight:面向大型视觉语言模型的自动生成多模态越狱提示红队测试
机器学习
2024-07-23 v1 人工智能
密码学与安全
多媒体
摘要
大型视觉语言模型(VLMs)拓展并增强了大型语言模型(LLMs)的感知能力。尽管这些进展为 LLM 应用提供了新的可能,但也引发了关于生成有害内容的显著安全和伦理 concerns。虽然 LLMs 已通过红队框架获得了广泛的安全评估,但目前 VLMs 缺乏成熟的红队框架。为填补这一空白,我们引入Arondight,一个专为 VLMs 设计的标准化红队框架。Arondight致力于解决将现有红队方法从 LLMs 转移到 VLMs 时遇到的视觉模态缺失和样本多样性不足的问题。我们的框架具备自动化的多模态越狱攻击机制,其中由红队 VLMs 生成视觉越狱提示,由红队 LLM 生成文本提示。为增强 VLMS 安全评估的全面性,我们集成了熵惩罚和新颖度奖励指标,这些元素激励 RL 代理引导红队 LLM 创建更广泛的多样且此前未出现的测试案例。我们对十个最先进的 VLMS进行评估,揭示了在生成有毒图像和多模态提示对齐方面存在显著的安全漏洞。特别是,我们的Arondight在GPT-4上实现了84.5%的平均攻击成功率,覆盖OpenAI在14个禁止情景中定义的生成有毒文本情景。为了更清晰的比较,我们还根据 VLMS 的安全水平对现有 VLMS进行了分类,并提供了相应的强化建议。我们的多模态提示数据集和红队代码将在伦理委员会批准后发布。内容警告:本文包含有害模型响应。
引用
@article{arxiv.2407.15050,
title = {Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts},
author = {Yi Liu and Chengjun Cai and Xiaoli Zhang and Xingliang Yuan and Cong Wang},
journal= {arXiv preprint arXiv:2407.15050},
year = {2024}
}
备注
To be published in ACM MM 2024