SAFEx:通过稳定性安全关键专家识别分析基于 Mixture-of-Experts 的 LLMs 漏洞
机器学习
2025-10-14 v2 人工智能
密码学与安全
摘要
拥有 Mixture-of-Experts(MoE)架构的大型语言模型在效率和可扩展性方面取得显著进展,但其路由机制引入的安全对齐挑战尚未得到针对稠密模型技术充分解决。本文正式化并系统性分析了 MoE 特有的位点脆弱性——即安全对齐行为依赖于特定专家模块的风险。提出一种分析框架 SAFEx,通过基于稳定性的专家选择程序来稳健识别、刻画和验证安全关键专家,并将其功能分为两个组:有害内容检测组(HCDG),专注于识别和识别用户输入中的有害内容;有害响应控制组(HRCG),专注于控制和强制模型生成恰当的安全响应。对选定专家进行干预以探索因果关系并测试缓解措施。对 SAFEx 所选专家进行有针对性的掩码显示,安全行为高度集中。在配置 48 层 MoE-FFN 且每层 128 个专家、采用 Top-8 路由(共 6,144 个专家)的 Qwen3-30B-A3B 上,禁用 12 个选中专家可使拒绝率降低 22%。此外,采用 LoRA 在三种配置下进行轻量级适配——分别为 HRCG、HCDG 与 HRCG 的联合体,以及全部专家——并通过针对 HRCG 的负权重合并构成更新,在不进行全模型重新训练的情况下改善对对抗性提示的拒绝能力。这些结果确立了位点脆弱性作为一种独特 MoE 安全挑战,并提供了一种实用、计算高效的路径,以进行路由体系结构中的专家级安全干预。
引用
@article{arxiv.2506.17368,
title = {SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification},
author = {Zhenglin Lai and Mengyao Liao and Bingzhe Wu and Dong Xu and Zebin Zhao and Zhihang Yuan and Chao Fan and Jianqiang Li},
journal= {arXiv preprint arXiv:2506.17368},
year = {2025}
}
备注
10 pages, 8 figures