大型语言脑叶切除术:通过专家静默破解混合专家模型
密码学与安全
2026-02-10 v1
摘要
混合专家(MoE)架构的快速采用标志着大型语言模型(LLM)部署的重大转变。MoE LLM 通过仅激活每个 token 的一小部分参数来提高扩展效率,但其路由结构引入了新的安全攻击面。我们发现 MoE LLM 中的安全关键行为(例如,拒绝回答)集中在少数专家中,而不是均匀分布。基于此,我们提出了大型语言脑叶切除术(L³),这是一种无需训练、架构无关的攻击,通过利用专家路由动态来破坏安全对齐。L³ 学习与拒绝回答相关的路由模式,将安全行为归因于特定专家,并自适应地静默最相关的安全专家,直到产生有害输出。我们在八个最先进的开源 MoE LLM 上评估了 L³,结果表明,我们的自适应专家静默将平均攻击成功率从 7.3% 提高到 70.4%,最高达到 86.3%,优于先前的无训练 MoE 越狱方法。此外,绕过护栏通常需要静默少于 20% 的逐层专家,同时很大程度上保留了通用语言能力。这些结果揭示了效率驱动的 MoE 设计与鲁棒安全对齐之间的根本张力,并激励在未来的 MoE LLM 中,通过架构感知和路由感知的方法更鲁棒地分布安全机制。
引用
@article{arxiv.2602.08741,
title = {Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing},
author = {Jona te Lintelo and Lichao Wu and Stjepan Picek},
journal= {arXiv preprint arXiv:2602.08741},
year = {2026}
}