Breaking Bad:基于可解释性的最先进LLM安全审计
密码学与安全
2026-04-24 v1 机器学习
摘要
大型语言模型(LLM)的有效安全审计需要超越黑盒探测、系统性地揭示根植于模型内部漏洞的工具。我们提出了对八个SOTA开源LLM的全面、可解释性驱动的越狱审计:Llama-3.1-8B、Llama-3.3-70B-4bt、GPT-oss-20B、GPT-oss-120B、Qwen3-0.6B、Qwen3-32B、Phi4-3.8B和Phi4-14B。利用基于可解释性的方法——通用引导(US)和表征工程(RepE)——我们引入了一种自适应两阶段网格搜索算法,以识别不安全行为概念的最优激活引导系数。我们在精选的有害查询集和标准化LLM评判协议上进行的评估揭示了模型鲁棒性的鲜明对比。Llama-3模型高度脆弱,在Llama-3.3-70B-4bt上,通过US和RepE的越狱响应率分别高达91%和83%,而GPT-oss-120B对两种可解释性方法的攻击均保持鲁棒。Qwen和Phi模型结果不一,较小的Qwen3-0.6B和Phi4-3.8B大多表现出较低的越狱率,而其较大版本则更易受影响。我们的结果表明,基于可解释性的引导是进行系统性安全审计的强大工具,但也凸显了其双重用途风险以及在LLM部署中需要更好的内部防御。
引用
@article{arxiv.2604.20945,
title = {Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs},
author = {Krishiv Agarwal and Ramneet Kaur and Colin Samplawski and Manoj Acharya and Anirban Roy and Daniel Elenius and Brian Matejek and Adam D. Cobb and Susmit Jha},
journal= {arXiv preprint arXiv:2604.20945},
year = {2026}
}