贝叶斯代际基于种群的训练
机器学习
2022-07-20 v1 人工智能
摘要
强化学习(RL)提供了训练能够自主在真实世界中交互的通用智能体的潜力。然而,一个关键限制是 RL 算法对核心超参数和网络架构选择的脆弱性。此外,训练数据演化和智能体复杂性增加等非平稳性意味着不同的超参数和架构在训练的不同阶段可能是最优的。这催生了 AutoRL,一类旨在自动化这些设计选择的方法。基于种群的训练(PBT)是 AutoRL 方法中一类突出的方法,已在多个大规模场景中取得令人印象深刻的性能。在本文中,我们在 PBT 风格的方法中引入了两项创新。首先,我们采用基于信赖域的贝叶斯优化,实现对高维混合超参数搜索空间的全覆盖。其次,我们表明使用代际方法,我们还可以在单次训练运行中联合在线学习架构和超参数。利用新的高度可并行的 Brax 物理引擎,我们表明这些创新带来了巨大的性能提升,在在线学习完整配置的同时显著优于调优的基线。代码可在 https://github.com/xingchenwan/bgpbt 获取。
引用
@article{arxiv.2207.09405,
title = {Bayesian Generational Population-Based Training},
author = {Xingchen Wan and Cong Lu and Jack Parker-Holder and Philip J. Ball and Vu Nguyen and Binxin Ru and Michael A. Osborne},
journal= {arXiv preprint arXiv:2207.09405},
year = {2022}
}
备注
AutoML Conference 2022. 10 pages, 4 figure, 3 tables (28 pages, 10 figures, 7 tables including references and appendices)