重访 JBShield:打破并重构表示级越狱防御
摘要
针对大语言模型(LLM)的越狱攻击防御,例如贪心坐标梯度(Greedy Coordinate Gradient, GCG),在针对性威胁模型下仍是一个挑战,其中攻击者直接针对防御机制。JBShield 是一种最近的越狱防御方法,在某些设置下其攻击成功率为 0%。该方法通过两种概念信号检测恶意提示:一种是有毒概念,另一种是越狱概念。我们设计 JB-GCG,修改 GCG 的目标函数,融合两个术语:通过隐藏状态表示与拒绝方向之间的余弦相似度抑制拒绝指向,以及通过 JBShield 自身的有毒概念得分实现有毒概念正则化。在 Llama-3-8B 上进行的五种配置测试中,JB-GCG 实现了平均 46.2% 的攻击成功率(ASR),最强设置下达到 53.4%。我们进一步展示了该攻击对 JBShield-M 仍然有效,在评估的各种设置下实现最高 30.7% 的 ASR。该攻击在多种 JBShield 重校准设置下依然有效,这表明该漏洞是结构性的而非校准特定的。我们分析了越狱表示的余弦相似度特征,发现它们在拒绝方向指纹空间中占据一个独特的区域,而 neither 无害 提示 nor 有害 提示 都不在其中。我们引入表示轨迹验证(Representation Trajectory Verification, RTV),这是一种基于多层拒绝方向指纹的马哈拉逐距离异常检测的新型防御方法。RTV 在针对我们攻击时实现了 0.99 的 AUROC。最后,我们设计并评估了一个针对 RTV 的额外自适应攻击,采用对防御的完全白盒知识;最佳攻击仅实现 7% 的 ASR,却增加了 13 倍的计算成本。我们的结果表明,强非自适应检测并不意味着在自适应威胁模型下具有鲁棒性,多层表示一致性比单层概念相似性更可靠地支持越狱检测。
引用
@article{arxiv.2605.03095,
title = {Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses},
author = {Kemal Derya and Berk Sunar},
journal= {arXiv preprint arXiv:2605.03095},
year = {2026}
}