面向安全的Mixtral MoE在良性与有害提示下的路由分析
人工智能
2026-05-26 v1 密码学与安全
摘要
稀疏混合专家(MoE)语言模型仅为每个token激活少数子集参数,使得路由器行为成为模型计算的核心部分。本文研究了Mixtral 8x7B-Instruct在良性和有害提示下的路由行为,采用两种互补信号:从专家选择频率派生的基于激活的路由得分,以及来自路由器门控灵敏度的梯度得分。我们分析了专家级和层级的路由行为,并进行了专家抑制干预。结果表明,基于激活的专家使用广泛且呈长尾分布,而梯度基于的重要性则集中。对于专家层面,良性和有害提示组在两种信号下保持接近,仅有适度分离。在层面上,基于激活的路由在8-15层附近最为挑剔,而梯度基于的重要性集中在后期层数。专家分类显示,大多数专家在良性和有害提示中均被共享,虽然有一小部分专家显示出明显的群体偏好。顶级专家集合在梯度得分下表现出更强的良性-恶意重叠,优于激活得分,暗示了对常见后期层专家集合的集中。
引用
@article{arxiv.2605.24270,
title = {Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts},
author = {Md Nurul Absar Siddiky},
journal= {arXiv preprint arXiv:2605.24270},
year = {2026}
}