稀疏模型,稀疏安全:混合专家大语言模型中的不安全路径
机器学习
2026-02-10 v1 人工智能
密码学与安全
摘要
通过引入路由器以选择性激活Transformer层中的专家,混合专家(MoE)架构显著降低了大型语言模型(LLM)的计算成本,同时保持了有竞争力的性能,尤其是对于具有海量参数的模型。然而,先前的工作主要关注效用和效率,而忽略了与此稀疏架构相关的安全风险。在这项工作中,我们通过发现不安全路径来表明MoE LLM的安全性与其架构一样稀疏:这些路由配置一旦被激活,就会将安全输出转化为有害输出。具体来说,我们首先引入路由器安全重要性分数(RoSais)来量化每层路由器的安全关键性。仅操纵高RoSais路由器即可将默认路径翻转为不安全路径。例如,在JailbreakBench上,屏蔽DeepSeek-V2-Lite中的5个路由器使攻击成功率(ASR)提高了4倍以上,达到0.79,突显了路由器操纵可能在MoE LLM中自然发生的固有风险。我们进一步提出了一种细粒度的逐令牌逐层随机优化框架,以发现更具体的不安全路径(F-SOUR),该框架明确考虑了输入令牌的顺序性和动态性。在四个代表性的MoE LLM系列中,F-SOUR在JailbreakBench和AdvBench上分别达到了0.90和0.98的平均ASR。最后,我们概述了防御视角,包括安全感知的路由禁用和路由器训练,作为保护MoE LLM的有前景方向。我们希望我们的工作能为未来MoE LLM的红队测试和安全防护提供参考。我们的代码可在 https://github.com/TrustAIRLab/UnsafeMoE 获取。
引用
@article{arxiv.2602.08621,
title = {Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs},
author = {Yukun Jiang and Hai Huang and Mingjie Li and Yage Zhang and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2602.08621},
year = {2026}
}