理解 Mixture-of-Experts LLM 中的安全敏感专家行为
计算与语言
2026-05-29 v1
摘要
Mixture-of-Experts (MoE) 大语言模型依赖稀疏、路由驱动的专家激活,但安全对齐如何与路由专家专业化相互作用仍未得到充分探索。常见直觉是,安全行为可能通过将有害请求路由到独立的拒绝导向专家来控制。本文提供了不同的实证证据:aligned MoE LLM 的路由模式主要是主题驱动的,而安全行为可通过极少改变模型内在路由路径的方式进行更改。鼓掂此观察,我们提出了 **RASET** (**R**outer-**A**gnostic **S**afety-critical **E**xpert **T**uning),一个红队测试框架,用于探测局限于小部分专家内部的安全强制,而不改变模型的内在路由行为。**RASET** 通过对比路由灵敏度准则识别安全关键专家,并仅对选定专家应用参数高效调优,从而最小化相对于 router-steering 干预的语义扰动。这些结果揭示了一种 distinct 的 MoE 安全风险,凸显了需要专家感知对齐机制的需求。
引用
@article{arxiv.2605.29708,
title = {Understanding Safety-Sensitive Expert Behavior in Mixture-of-Experts LLMs},
author = {Zhibo Zhang and Yuxi Li and Zhen Ouyang and Ling Shi and Kailong Wang},
journal= {arXiv preprint arXiv:2605.29708},
year = {2026}
}
备注
11 pages, 4 figures