揭示 GPT-4o 的安全性:基于越狱攻击的实证研究
密码学与安全
2024-07-04 v2 计算机视觉与模式识别
摘要
GPT-4o 的近期发布因其强大的通用能力而引起了广泛关注。尽管其令人瞩目的性能得到广泛认可,但其安全性方面尚未得到充分探索。鉴于 GPT-4o 等先进生成式 AI 生成的风险内容可能产生的社会影响,对其安全性进行严格评估至关重要。针对这一问题,本文首次针对 GPT-4o 抵御越狱攻击的安全性进行了严格评估。具体而言,本文在涵盖三种模态(即文本、语音和图像)的 4 个常用基准上,采用了一系列多模态和单模态越狱攻击,涉及对超过 4000 个初始文本查询的优化,以及对 GPT-4o 上近 8000+ 条响应的分析与统计评估。我们广泛的实验揭示了若干新发现:(1)与之前的版本(如 GPT-4V)相比,GPT-4o 在文本模态越狱情境下的安全性有所提升;(2)新引入的音频模态为针对 GPT-4o 的越狱攻击开辟了新的攻击向量;(3)现有的黑盒多模态越狱攻击方法对 GPT-4o 和 GPT-4V 基本无效。这些发现为 GPT-4o 的安全性影响提供了关键见解,并凸显了大模型中对齐护栏的需求。我们的代码可在 \url{https://github.com/NY1024/Jailbreak_GPT4o} 获取。
引用
@article{arxiv.2406.06302,
title = {Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks},
author = {Zonghao Ying and Aishan Liu and Xianglong Liu and Dacheng Tao},
journal= {arXiv preprint arXiv:2406.06302},
year = {2024}
}