中文

无可控性的路由敏感性:MoE语言模型公平性的诊断研究

计算与语言 2026-04-13 v1

摘要

混合专家(Mixture-of-Experts, MoE)语言模型在路由层面对人口统计内容普遍敏感,但利用这种敏感性进行公平性控制受到结构限制。我们引入公平感知路由均衡(Fairness-Aware Routing Equilibrium, FARE),一个旨在探测不同 MoE 架构中路由层面刻板印象干预极限的诊断框架。FARE 揭示,路由层面的偏好偏移要么不可实现(Mixtral、Qwen1.5、Qwen3),要么统计上不稳健(DeepSeekMoE),要么伴随显著的效用代价(OLMoE,在 CrowS-Pairs 上 -4.4p,在 TQA 上 -6.3p)。关键的是,即使对数似然偏好偏移是稳健的,它们也不会转移到解码生成中:在所有生成指标上对非空模型的扩展评估均产生零结果。组级专家掩码揭示了原因:偏见和核心知识在专家组内深度纠缠。这些发现表明路由敏感性是刻板印象控制的必要但不充分条件,并识别了可指导未来更可控 MoE 系统设计的特定架构条件。

关键词

引用

@article{arxiv.2603.27141,
  title  = {Routing Sensitivity Without Controllability: A Diagnostic Study of Fairness in MoE Language Models},
  author = {Junhyeok Lee and Kyu Sung Choi},
  journal= {arXiv preprint arXiv:2603.27141},
  year   = {2026}
}

备注

10 pages, 2 figures, 8 tables