中文

混合专家解锁深度强化学习的参数缩放

机器学习 2024-06-27 v3 人工智能

摘要

近期(自)监督学习模型的快速进展在很大程度上由经验缩放定律所预测:模型的性能与其大小成正比。然而,类似的缩放定律在强化学习领域仍然难以捉摸,增加模型的参数数量通常会损害其最终性能。在本文中,我们证明了将混合专家模块,特别是 Soft MoE (Puigcerver et al., 2023),引入基于价值的网络中会产生更具参数可缩放性的模型,这一点在各种训练机制和模型大小下显著的性能提升中得到了证明。因此,这项工作为开发强化学习的缩放定律提供了强有力的经验证据。

关键词

引用

@article{arxiv.2402.08609,
  title  = {Mixtures of Experts Unlock Parameter Scaling for Deep RL},
  author = {Johan Obando-Ceron and Ghada Sokar and Timon Willi and Clare Lyle and Jesse Farebrother and Jakob Foerster and Gintare Karolina Dziugaite and Doina Precup and Pablo Samuel Castro},
  journal= {arXiv preprint arXiv:2402.08609},
  year   = {2024}
}