AutoJailbreak:通过依赖视角探索越狱攻击与防御
密码学与安全
2024-06-07 v1
摘要
大型语言模型(LLM)中的越狱攻击涉及通过使用恶意提示诱导模型生成违反伦理和法律规范的内容,构成对LLM安全的重大威胁。当前的越狱攻击和防御策略常常局限于特定算法框架内进行局部优化,导致优化效果不佳且可扩展性有限。本文提出了一种系统性分析LLM越狱攻击与防御技术中依赖关系的方法,将其概括为所有可能的攻击面。我们采用有向无环图(DAGs)对现有越狱攻击、防御和评估方法进行定位与分析,并提出三个全面、自动化且逻辑性强的框架。`AutoAttack`探讨了两种越狱优化策略中的依赖关系:基于遗传算法(GA)的攻击和基于对抗生成的攻击。随后我们引入一个集成越狱攻击以利用这些依赖关系。`AutoDefense`通过利用预生成和后生成防御策略中的依赖关系,提出一种混合防御方法。`AutoEvaluation`引入一种新颖的评估方法,以区分常被忽视的幻觉输出与越狱攻击和防御响应。通过大量实验,我们展示了所提出的集成越狱攻击和防御框架显著优于现有研究。
引用
@article{arxiv.2406.03805,
title = {AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens},
author = {Lin Lu and Hai Yan and Zenghui Yuan and Jiawen Shi and Wenqi Wei and Pin-Yu Chen and Pan Zhou},
journal= {arXiv preprint arXiv:2406.03805},
year = {2024}
}
备注
32 pages, 2 figures