BadMoE:通过优化路由触发器感染潜在专家来攻击 Mixture-of-Experts LLM
密码学与安全
2025-04-30 v2 人工智能
摘要
Mixture-of-Experts(MoE)已成为大型语言模型(LLM)的强大架构,能够在保持可管理计算成本的同时实现模型容量的有效扩展。其关键优势在于能够将不同标记路由到模型内部的不同“专家”网络,从而实现专业化并高效处理多样化输入。然而,MoE 基于 LLM 的漏洞仍几乎未受到研究, backdoor 攻击在此背景下的潜在风险亦鲜有探讨。本文提出首个针对 MoE 基于 LLM 的 backdoor 攻击,攻击者通过优化路由触发器来感染和激活“潜在专家”(即未被充分利用的专家),从而控制模型的输出。我们首先严格证明了 MoE 模型中存在少数“支配专家”的可能性,这些专家的输出可决定整体 MoE 的输出。我们还表明,潜在专家可作为支配专家,以操纵模型预测。基于此,我们的攻击方法 BadMoE 通过 1)识别与目标任务无关的潜在专家, 2)构建面向路由的损失函数以优化这些专家的激活触发器, 3)通过被污染的训练数据将潜在专家提升为支配性角色。广泛实验表明,BadMoE 成功实现对攻击者目标任务的恶意预测,同时保持整体模型效用,使其比现有方法更具威胁性和隐蔽性。
引用
@article{arxiv.2504.18598,
title = {BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts},
author = {Qingyue Wang and Qi Pang and Xixun Lin and Shuai Wang and Daoyuan Wu},
journal= {arXiv preprint arXiv:2504.18598},
year = {2025}
}