中文

通过带系统提示的自对抗攻击越狱 GPT-4V

密码学与安全 2024-01-23 v2 人工智能 机器学习

摘要

现有的多模态大语言模型(MLLM)越狱工作主要关注模型输入中的对抗样本,较少关注漏洞,尤其是模型 API 中的漏洞。为填补研究空白,我们开展了以下工作:1) 我们发现 GPT-4V 中存在系统提示泄露漏洞。通过精心设计的对话,我们成功提取了 GPT-4V 的内部系统提示。这一发现表明 MLLM 中存在潜在可利用的安全风险;2) 基于获取的系统提示,我们提出了一种称为 SASP(通过系统提示的自对抗攻击)的新型 MLLM 越狱攻击方法。通过让 GPT-4 作为红队工具攻击自身,我们旨在利用窃取的系统性提示搜索潜在的越狱提示。此外,为追求更好性能,我们还基于 GPT-4 的分析加入了人工修改,将攻击成功率进一步提升至 98.7%;3) 我们评估了修改系统提示以防御越狱攻击的效果。结果表明,适当设计的系统提示可显著降低越狱成功率。总体而言,我们的工作为增强 MLLM 安全性提供了新见解,展示了系统提示在越狱中的重要作用。该发现既可用于大幅提高越狱成功率,也具有防御越狱的潜力。

关键词

引用

@article{arxiv.2311.09127,
  title  = {Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts},
  author = {Yuanwei Wu and Xiang Li and Yixin Liu and Pan Zhou and Lichao Sun},
  journal= {arXiv preprint arXiv:2311.09127},
  year   = {2024}
}