中文

从守护者到恶魔?LLM 防御引发的意外风险交互

密码学与安全 2026-01-21 v2

摘要

大语言模型(LLM)在各种应用中已展现出显著性能,但其在真实场景中的部署面临若干风险,包括越狱攻击和隐私泄露。为缓解这些风险,已提出众多防御策略。然而,大多数现有研究孤立地评估这些防御,忽略了它们对其他风险维度的影响。在本工作中,我们引入了一种新的跨风险评估范式,并迈出了调查 LLM 中防御之间意外交互的第一步。具体而言,我们聚焦于安全性、公平性和隐私性之间的相互作用。为此,我们提出了 CrossRiskEval,一个系统刻画针对某一风险(如安全性)设计的防御如何影响其他风险(如公平性或隐私性)的框架。我们对 14 个已部署防御的 LLM 进行了广泛的实证研究和机制分析,涵盖 12 种防御策略。结果表明,针对单一风险的防御往往对其他风险产生可测量的影响。这些影响在方向和大孝范围因素(如模型、任务和防御策略)上有所不同,并且在风险对之间往往是不对称的。此外,我们的机制分析表明,这些交互并非随机:它们源于冲突纠缠神经元,即在不同风险上以相反方式贡献的共享内部表示。因此,调整某一风险会扰动这些表示,并导致非目标风险的系统性变化。这些发现揭示了单一风险评估的局限性,并强调了在设计和部署 LLM 防御时需要整体和交互感知的评估。

关键词

引用

@article{arxiv.2510.07968,
  title  = {From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses},
  author = {Xiangtao Meng and Tianshuo Cong and Li Wang and Wenyu Chen and Zheng Li and Shanqing Guo and Xiaoyun Wang},
  journal= {arXiv preprint arXiv:2510.07968},
  year   = {2026}
}