Mixture-of-Experts 融合类内强化学习
机器学习
2025-10-29 v3 人工智能
摘要
类内强化学习(ICRL)通过提示条件化来适应下游任务,已成为一种有前景的范式。然而,充分发挥类内学习在 RL 领域的潜力仍面临两个显著挑战:状态-动作-奖励数据内在的多模态性以及决策任务的多样性和异构性。为此,我们提出了 T2MIR(Token-和 Task-wise MoE for In-context RL),一种创新的框架,将混合专家(MoE)引入基于转换器的决策模型中。T2MIR 用两个平行层取代前馈层:一个用于 token-wise MoE,捕捉输入 token 在多模态数据中的不同语义,一个用于 task-wise MoE,将不同任务路由到专门的专家,以处理广泛的任务分布并减轻梯度冲突。为增强 task-wise 路由,我们引入了对比学习方法,以最大化任务与其路由表示之间的互信息,从而更精确地捕获任务相关信息。两个 MoE 组件的输出被拼接后输入到下一层。全面实验表明,T2MIR 显著提升了类内学习能力,优于各种基线方法。我们展示了 MoE 在 ICRL 中的潜力与前景,为 RL 社区提供了一个简单且可扩展的架构增强,使其更接近语言和视觉社区的成就。我们的代码已在 https://github.com/NJU-RL/T2MIR 上发布。
引用
@article{arxiv.2506.05426,
title = {Mixture-of-Experts Meets In-Context Reinforcement Learning},
author = {Wenhao Wu and Fuhong Liu and Haoru Li and Zican Hu and Daoyi Dong and Chunlin Chen and Zhi Wang},
journal= {arXiv preprint arXiv:2506.05426},
year = {2025}
}
备注
28 pages, 13 figures, 17 tables