中文

通过专家激活与去激活引导 MoE LLMs

计算与语言 2026-02-13 v2 机器学习

摘要

大型语言模型 (LLMs) 中的混合专家模型 通过将每个 token 路由至一组专用的前馈网络 (FFN)(即专家)来处理输入。我们提出 SteerMoE,一个通过检测和控制行为关联专家来引导 MoE 模型的框架。我们通过比较专家在表现出相反行为(例如安全与不安全)的成对输入中的激活频率来检测关键专家。通过在推理过程中选择性地激活或去激活此类专家,我们无需微调即可控制忠实度与安全性等行为。在 11 个基准测试和 6 个 LLMs 上,我们的引导方法将安全性提升了高达 +20%,将忠实度提升了 +27%。另一方面,不安全引导单独即可使安全性下降 -41%,当与现有越狱方法结合时则下降 -100%,从而绕过所有安全防护。总体而言,SteerMoE 提供了一种轻量、高效且广泛适用的测试时控制方法,同时揭示了 MoE LLMs 中独特的脆弱性。https://github.com/adobe-research/SteerMoE

关键词

引用

@article{arxiv.2509.09660,
  title  = {Steering MoE LLMs via Expert (De)Activation},
  author = {Mohsen Fayyaz and Ali Modarressi and Hanieh Deilamsalehy and Franck Dernoncourt and Ryan Rossi and Trung Bui and Hinrich Schütze and Nanyun Peng},
  journal= {arXiv preprint arXiv:2509.09660},
  year   = {2026}
}

备注

ICLR 2026