中文

GateBreaker:针对混合专家大语言模型的基于门控引导的攻击

密码学与安全 2025-12-29 v2

摘要

混合专家(MoE)架构通过为每个输入仅激活稀疏的参数子集,推进了大型语言模型(LLMs)的扩展,以降低的计算成本实现了最先进的性能。随着这些模型越来越多地部署在关键领域,理解并加强其对齐机制对于防止有害输出至关重要。然而,现有的 LLM 安全研究几乎完全集中在密集架构上,使得 MoE 独特的安全属性在很大程度上未被审视。MoE 的模块化、稀疏激活设计表明,其安全机制的运作方式可能与密集模型不同,这引发了对其鲁棒性的质疑。在本文中,我们提出了 GateBreaker,这是第一个无需训练、轻量级且与架构无关的攻击框架,可在推理时破坏现代 MoE LLM 的安全对齐。GateBreaker 分三个阶段运作:(i)门控级剖析,识别出在有害输入上被不成比例路由的安全专家;(ii)专家级定位,定位安全专家内部的安全结构;(iii)定向安全移除,禁用已识别的安全结构以破坏安全对齐。我们的研究表明,MoE 的安全性集中在由稀疏路由协调的一小部分神经元中。选择性禁用这些神经元(约占目标专家层中神经元的 3%),在有限的效用下降下,将针对八个最新对齐的 MoE LLM 的平均攻击成功率(ASR)从 7.4% 显著提高到 64.9%。这些安全神经元可在同一家族的模型间迁移,通过一次性迁移攻击将 ASR 从 17.9% 提高到 67.7%。此外,GateBreaker 可泛化到五个 MoE 视觉语言模型(VLMs),在不安全图像输入上达到 60.9% 的 ASR。

关键词

引用

@article{arxiv.2512.21008,
  title  = {GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs},
  author = {Lichao Wu and Sasha Behrouzi and Mohamadreza Rostami and Stjepan Picek and Ahmad-Reza Sadeghi},
  journal= {arXiv preprint arXiv:2512.21008},
  year   = {2025}
}

备注

Accepted by USENIX Security'26