CAVGAN:基于 LLM 内部表示的生成对抗攻击统一框架用于 Jailbreak 与防御
密码学与安全
2025-08-07 v2 人工智能
摘要
安全对齐机制使大语言模型(LLM)能够获得针对恶意查询的保护,但各种越狱攻击方法揭示了这一安全机制的脆弱性。以往研究将 LLM 越狱攻击与防御分离。我们分析了 LLM 的安全保护机制,提出一种结合攻击与防御的框架。该方法基于 LLM 中间层嵌入的线性可分性,以及越狱攻击的本质——即将有害问题嵌入并转化移至安全区域。我们利用生成对抗网络(GAN)学习 LLM 内部安全判断边界,以实现高效的越狱攻击和防御。实验结果表明,该方法在三个流行 LLM 上实现了 88.85% 的平均越狱成功率,而在最新越狱数据集上的防御成功率达到了 84.17%。这不仅验证了我们方法的有效性,也为理解 LLM 的内部安全机制提供了新视角,为增强模型安全性提供了新的思路。代码和数据已公开于 https://github.com/NLPGM/CAVGAN。
引用
@article{arxiv.2507.06043,
title = {CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations},
author = {Xiaohu Li and Yunfeng Ning and Zepeng Bao and Mayi Xu and Jianhao Chen and Tieyun Qian},
journal= {arXiv preprint arXiv:2507.06043},
year = {2025}
}
备注
Accepted to ACL 2025 (Findings), camera-ready version