站在巨人的肩膀上:基于以往攻击经验构建JailExpert
密码学与安全
2025-08-28 v1 人工智能
摘要
大型语言模型(LLMs)在特定安全约束下生成符合人类价值观的内容。然而,当前已知的“越狱提示”技术可以绕过安全对齐措施,诱导LLMs输出恶意内容。越狱研究有助于识别LLMs的漏洞,并指导鲁棒安全框架的开发。为解决攻击模板随模型演进而过时的问题,现有方法采用迭代变异和动态优化来促进更自动化的越狱攻击。然而,这些方法面临两个挑战:效率低下和重复优化,因为它们忽视了以往攻击经验的价值。为了更好地整合以往攻击经验以辅助当前的越狱尝试,我们提出了JailExpert,一个自动化的越狱框架,它首次实现了经验结构的正式表示,基于语义漂移对经验进行分组,并支持经验池的动态更新。大量实验表明,JailExpert显著提高了攻击效果和效率。与当前最先进的黑盒越狱方法相比,JailExpert的攻击成功率平均提高了17%,攻击效率提高了2.7倍。我们的代码可在https://github.com/xiZAIzai/JailExpert获取。
引用
@article{arxiv.2508.19292,
title = {Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience},
author = {Xi Wang and Songlei Jian and Shasha Li and Xiaopeng Li and Bin Ji and Jun Ma and Xiaodong Liu and Jing Wang and Feilong Bao and Jianfeng Zhang and Baosheng Wang and Jie Yu},
journal= {arXiv preprint arXiv:2508.19292},
year = {2025}
}
备注
18 pages, EMNLP 2025 Main Conference