中文

触发器的“谁说话”?被篡改的混合专家变压器中的动态专家路由

密码学与安全 2025-10-16 v1

摘要

大型语言模型(LLM)采用混合专家(MoE)架构可通过动态路由输入到 specialized 子网络(即专家)以实现卓越的性能和效率。 然而,这种稀疏路由机制由于专家专业化,天然具有任务偏好,导致其对后门攻击存在新的且未充分探索的脆弱性。 本文研究了利用其内在的专家路由偏好将后门注入MoE-based LLM的可行性和有效性。 我们因此提出了 BadSwitch,一种 novel 后门框架,将任务耦合的动态触发器优化与灵敏度导引的 Top-S expert tracing机制集成。 我们的 approach 在预训练期间联合优化触发器嵌入并识别 S 个最敏感专家,随后约束 Top-K gating机制以这些目标专家。 不同于依赖浅显数据中毒或模型编辑的传统后门攻击,BadSwitch主要通过具有强任务亲和力的 expert routing path嵌入恶意触发器,从而实现精确且隐蔽的模型操纵。 通过对三大主流MoE架构(Switch Transformer、QwenMoE和DeepSeekMoE)进行全面评估,我们展示了BadSwitch可在保持最高干净准确率(ACC)的同时以最高达100%的成功率(ASR)劫持预训练模型。 此外,BadSwitch对文本水平和模型水平防御机制具有强大的韧性,在AGNews数据集上实现94.07%的ASR和87.18%的ACC。 我们分析了 expert activation patterns,揭示了MoE系统的根本性安全风险。 我们预计本工作将暴露MoE系统的安全风险,推动AI安全的发展。

关键词

引用

@article{arxiv.2510.13462,
  title  = {Who Speaks for the Trigger? Dynamic Expert Routing in Backdoored Mixture-of-Experts Transformers},
  author = {Xin Zhao and Xiaojun Chen and Bingshan Liu and Haoyu Gao and Zhendong Zhao and Yilong Chen},
  journal= {arXiv preprint arXiv:2510.13462},
  year   = {2025}
}