打破天花板:通过扩展策略空间探索越狱攻击的潜力
密码学与安全
2025-05-29 v2 人工智能
计算与语言
摘要
大型语言模型(LLMs)尽管具备先进的通用能力,但仍存在诸多安全风险,尤其是绕过安全协议的越狱攻击。通过能更好反映真实世界场景的黑盒越狱攻击来理解这些漏洞,为模型鲁棒性提供了关键见解。虽然现有方法通过各种提示工程技术显示出改进,但它们对安全对齐模型的成功仍然有限,忽略了一个更根本的问题:其有效性本质上受限于预定义的策略空间。然而,扩展此空间在系统捕获基本攻击模式和高效导航增加的复杂性方面都带来了重大挑战。为了更好地探索扩展策略空间的潜力,我们通过一个新颖的框架应对这些挑战,该框架基于详尽可能性模型(ELM)理论将越狱策略分解为基本组件,并开发了带有意图评估机制的基于遗传的优化。引人注目的是,我们的实验通过扩展策略空间揭示了前所未有的越狱能力:我们在Claude-3.5上实现了超过90%的成功率,而先前的方法完全失败,同时展示了强大的跨模型可迁移性,并在评估准确性上超越了专门的安全防护模型。代码开源于:https://github.com/Aries-iai/CL-GSO。
引用
@article{arxiv.2505.21277,
title = {Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space},
author = {Yao Huang and Yitong Sun and Shouwei Ruan and Yichi Zhang and Yinpeng Dong and Xingxing Wei},
journal= {arXiv preprint arXiv:2505.21277},
year = {2025}
}
备注
19 pages, 20 figures, accepted by ACL 2025, Findings