中文

面向混合专家模型中多语言下游任务的路由对齐微调

计算与语言 2026-05-28 v1 人工智能

摘要

混合专家 (MoE) 模型已成为高效扩大大语言模型 (LLM) 的主导范式,但将其适配非英语下游任务仍富有挑战性。现有微调方法将 MoE 模型视为单一学习器,忽略了在预训练期间形成的异构路由结构。我们在多个 MoE 模型和下游任务上验证了中层形成语言通用对齐区,其中路由分歧强烈预测每种语言的任务性能差距。基于此观察,我们提出了 RA-MoE (Routing-Aligned MoE Fine-Tuning),是一个三阶段框架,将平行任务示例划分为基于英语和目标语言正确性的四向分类 (cc/ci/ic/ii),识别中层中的任务相关专家,并以路由对齐损失增强标准 SFT,鼓励目标语言在 ci 类型示例上的路由遵循英语任务专家激活模式。在三个 MoE 模型、三个任务和六种目标语言上的实验表明,RA-MoE 在所有基准上均一致优于标准 SFT 和强大 baselines,包括 Routing Steering 和 RISE,其中任务-语言对的 ci 比例可作为对齐收益的可靠预测器。

关键词

引用

@article{arxiv.2605.28305,
  title  = {Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning},
  author = {Yahan Yu and Noa Nakanishi and Fei Cheng},
  journal= {arXiv preprint arXiv:2605.28305},
  year   = {2026}
}

备注

15 pages, 12 figures