混合专家解锁深度强化学习的参数缩放
机器学习
2024-06-27 v3 人工智能
摘要
近期(自)监督学习模型的快速进展在很大程度上由经验缩放定律所预测:模型的性能与其大小成正比。然而,类似的缩放定律在强化学习领域仍然难以捉摸,增加模型的参数数量通常会损害其最终性能。在本文中,我们证明了将混合专家模块,特别是 Soft MoE (Puigcerver et al., 2023),引入基于价值的网络中会产生更具参数可缩放性的模型,这一点在各种训练机制和模型大小下显著的性能提升中得到了证明。因此,这项工作为开发强化学习的缩放定律提供了强有力的经验证据。
引用
@article{arxiv.2402.08609,
title = {Mixtures of Experts Unlock Parameter Scaling for Deep RL},
author = {Johan Obando-Ceron and Ghada Sokar and Timon Willi and Clare Lyle and Jesse Farebrother and Jakob Foerster and Gintare Karolina Dziugaite and Doina Precup and Pablo Samuel Castro},
journal= {arXiv preprint arXiv:2402.08609},
year = {2024}
}