中文

JBShield:通过激活概念分析与操控防御 LLM 恶意攻击

密码学与安全 2025-02-12 v1

摘要

尽管实施了安全对齐策略,大型语言模型(LLM)仍然 vulnerable 对抗恶意攻击,这些攻击削弱了这些安全护栏并构成重大安全威胁。一些防御措施已提出检测或缓解恶意攻击,但由于对恶意攻击机制的不足理解,无法持久抵御。本文基于线性表示假设(LRH)研究恶意攻击的机制,LRH 指出神经网络将高级概念编码为其隐藏表示中的子空间。我们将有害和恶意提示中的有毒语义定义为有毒概念,并将操控 LLM 响应以符合不安全请求的恶意提示语义定义为恶意概念。通过概念提取与分析,我们揭示了 LLM 能识别有毒概念,这些概念存在于有害提示和恶意提示中。然而,与有害提示不同,恶意提示会激活恶意概念并改变 LLM 输出,从拒绝转向顺从。基于我们的分析,我们提出了综合性的恶意攻击防御框架 JBShield,包括两个关键组件:用于检测恶意攻击的 JBShield-D 和用于缓解恶意攻击的 JBShield-M。JBShield-D 通过确定输入是否激活了有毒概念和恶意概念来识别恶意攻击。当检测到恶意攻击时,JBShield-M 会通过增强有毒概念并削弱恶意概念来调整目标 LLM 的隐藏表示,从而确保 LLM 生成安全内容。大量实验表明,JBShield 性能卓越,在不同 LLM 上实现 0.95 的平均检测准确率,将各种恶意攻击的平均攻击成功率从 61% 降至 2%。

关键词

引用

@article{arxiv.2502.07557,
  title  = {JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation},
  author = {Shenyi Zhang and Yuchen Zhai and Keyan Guo and Hongxin Hu and Shengnan Guo and Zheng Fang and Lingchen Zhao and Chao Shen and Cong Wang and Qian Wang},
  journal= {arXiv preprint arXiv:2502.07557},
  year   = {2025}
}

备注

To Appear in the 34rd USENIX Security Symposium, August 13-15, 2025