中文

通过安全路由对齐防御混合专家大语言模型的有害微调

密码学与安全 2025-10-10 v2 人工智能

摘要

近期的大语言模型(LLM)越来越多地采用混合专家(MoE)架构以提高效率。基于 MoE 的 LLM 严重依赖一种表层安全机制,即有害输入被路由到安全关键专家。然而,我们的分析揭示,微调后有害输入的路由决策会发生显著漂移,从而暴露出一个针对有害微调(HFT)攻击的关键漏洞。现有的防御措施主要针对单体 LLM 设计,对 MoE LLM 效果较差,因为它们无法阻止有害输入路由的漂移。为了解决这一局限性,我们提出了 SafeMoE,一种专为 MoE LLM 定制的安全微调方法。SafeMoE 通过惩罚微调模型与初始安全对齐模型之间路由权重的差距,直接缓解路由漂移,从而保持将有害输入路由到安全关键专家的安全对齐路由。在参数规模从 7B 到 141B 的开源 MoE LLM 上的实验表明,SafeMoE 能有效缓解 HFT 攻击,例如将 OLMoE 的有害性评分从 62.0 降至 5.0,同时将任务效用保持在 1% 的退化范围内,且仅产生 2% 的开销。它显著优于保护 LLM 微调的最先进防御方法,并且在近期的大规模 MoE LLM(如 gpt-oss 和 Llama 4)中依然有效。我们的实现代码可在 https://anonymous.4open.science/r/SafeMoE 获取。

关键词

引用

@article{arxiv.2509.22745,
  title  = {Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment},
  author = {Jaehan Kim and Minkyoo Song and Seungwon Shin and Sooel Son},
  journal= {arXiv preprint arXiv:2509.22745},
  year   = {2025}
}

备注

Under review