GPT-4 利用自我解释以近乎完美的成功率实现自身越狱
密码学与安全
2024-10-17 v2 人工智能
计算与语言
摘要
关于越狱的研究对于测试和理解大型语言模型(LLM)的安全与安保问题具有重要价值。在本文中,我们引入了迭代细化诱导自我越狱(IRIS),这是一种利用 LLM 的反思能力进行越狱的新方法,且仅需黑盒访问权限。与以往的方法不同,IRIS 通过使用单一模型同时充当攻击者和目标来简化越狱过程。该方法首先通过自我解释迭代地细化对抗性提示,这对于确保即使是经过良好对齐的 LLM 也能服从对抗性指令至关重要。然后,IRIS 对给定细化提示的输出进行评分和增强,以提高其有害性。我们发现,IRIS 在 GPT-4 上达到了 98% 的越狱成功率,在 GPT-4 Turbo 上达到了 92%,在 Llama-3.1-70B 上达到了 94%,且查询次数不超过 7 次。它在自动化、黑盒和可解释的越狱方面显著优于先前的方法,同时所需的查询次数大幅减少,从而为可解释的越狱方法确立了新标准。
引用
@article{arxiv.2405.13077,
title = {GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation},
author = {Govind Ramesh and Yao Dou and Wei Xu},
journal= {arXiv preprint arXiv:2405.13077},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main Conference