中文

混合专家在混合 RL 环境中的应用

机器学习 2024-06-27 v1 人工智能

摘要

混合专家 (Mixture of Experts, MoEs) 因其在推理效率、分布式训练适应性和模块化方面的优势而在(自我)监督学习中受到广泛关注。先前的研究表明,MoEs 可通过扩大网络参数规模并减少 dormant 神经元的数量,从而显著提升深度强化学习 (Deep Reinforcement Learning, DRL) 的性能,增强模型的学习能力以应对非平稳性。在本工作中,我们进一步阐述了 MoEs 处理非平稳性的能力,并通过多任务训练来放大非平稳性,进一步证明 MoEs 在 DRL 环境中的优势。与先前工作不同的是,我们的多任务结果使我们能够更好地理解 MoEs 在 DRL 训练中产生积极效果的根本原因、各类 MoE 组件的影响,以及如何在基于 actor-critic 的 DRL 网络中最佳地集成它们。最后,我们也确认了先前工作的结论。

关键词

引用

@article{arxiv.2406.18420,
  title  = {Mixture of Experts in a Mixture of RL settings},
  author = {Timon Willi and Johan Obando-Ceron and Jakob Foerster and Karolina Dziugaite and Pablo Samuel Castro},
  journal= {arXiv preprint arXiv:2406.18420},
  year   = {2024}
}