MoE-GRPO:基于强化学习优化视觉语言模型中的混合专家
计算机视觉与模式识别
2026-03-31 v2
摘要
混合专家 (Mixture-of-Experts, MoE) 已成为通过稀疏激活每个标记的子集参数来降低 Transformer 架构计算开销的有效方法,同时保持高模型容量。该范式最近扩展到视觉语言模型 (VLMs),实现可扩展的多模态理解并降低计算成本。然而,广泛采用的确定性 top-K 路由机制可能忽略更优的专家组合,导致专家过拟合。为此,我们提出 MoE-GRPO,一个用于优化基于 MoE 的 VLMs 中专家路由的强化学习 (RL) 框架。具体而言,我们将专家选择建模为序列决策问题,并使用 Group Relative Policy Optimization (GRPO) 进行优化,使模型能够通过探索和基于奖励的反馈学习自适应专家路由策略。进一步,我们引入模态感知路由引导,通过阻止路由器探索给定模态较少激活的专家,从而增强训练稳定性和效率。广泛实验表明,MoE-GRPO 在多模态图像和视频基准测试上一致优于标准 top-K 路由及其变体,通过促进更多样化的专家选择来缓解专家过拟合,实现任务级专家专化。
引用
@article{arxiv.2603.24984,
title = {MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models},
author = {Dohwan Ko and Jinyoung Park and Seoung Choi and Sanghyeok Lee and Seohyun Lee and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2603.24984},
year = {2026}
}
备注
Accepted at CVPR 2026