中文

通过混合专家决策 Transformer 掌握海量多任务强化学习

机器学习 2025-06-02 v1 人工智能

摘要

尽管离线多任务强化学习 (MTRL) 的最新进展已经利用了 Transformer 架构的强大能力,但大多数方法仅关注有限数量的任务,而扩展到极大规模任务仍然是一个艰巨的挑战。在本文中,我们首先重新审视了任务数量对当前 MTRL 方法的关键影响,并进一步揭示了随着任务数量的增加,简单地扩展参数不足以抵消性能退化。基于这些见解,我们提出了 M3DT,一种新颖的混合专家 框架,通过进一步释放模型的参数可扩展性来解决任务可扩展性问题。具体而言,我们增强了智能体的架构和优化,其中我们用 MoE 强化了 Decision Transformer (DT) 主干网络,以减少参数子集上的任务负载,并引入了三阶段训练机制以促进高效训练并实现最佳性能。实验结果表明,通过增加专家数量,M3DT 不仅在固定任务数量下作为模型扩展持续提升了性能,而且展现出显著的任务可扩展性,成功扩展到 160 个任务并取得了优异的性能。

关键词

引用

@article{arxiv.2505.24378,
  title  = {Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer},
  author = {Yilun Kong and Guozheng Ma and Qi Zhao and Haoyu Wang and Li Shen and Xueqian Wang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2505.24378},
  year   = {2025}
}

备注

ICML 2025