中文

基于自适应行为策略共享的强化学习数据高效训练

机器学习 2020-02-14 v1 人工智能 机器学习

摘要

深度强化学习(RL)已被证明在模拟环境中用于决策十分强大。然而,在真实世界应用(如生产级医疗或推荐系统)中训练深度 RL 模型具有挑战性,因为交互代价高昂且部署预算有限。数据低效的一个方面来自于优化深度神经网络时昂贵的超参数调优。我们提出自适应行为策略共享(ABPS),一种数据高效的训练算法,其允许共享由从一组以超参数集成训练的智能体池中自适应选出的行为策略所收集的经验。我们进一步将 ABPS 与改进版基于种群的训练(Population Based Training,ABPS-PBT)相混合,以在训练中演化超参数。我们使用多款 Atari 游戏(多达 16 种超参数/架构设置)进行实验。ABPS 取得了更优的整体性能、前 25% 智能体方差的降低,以及与独立训练的传统超参数调优在最佳智能体上相当的性能,尽管 ABPS 仅需要与环境交互与训练单个智能体相同的次数。我们还表明 ABPS-PBT 进一步提升了收敛速度并降低了方差。

关键词

引用

@article{arxiv.2002.05229,
  title  = {Data Efficient Training for Reinforcement Learning with Adaptive Behavior Policy Sharing},
  author = {Ge Liu and Rui Wu and Heng-Tze Cheng and Jing Wang and Jayden Ooi and Lihong Li and Ang Li and Wai Lok Sibon Li and Craig Boutilier and Ed Chi},
  journal= {arXiv preprint arXiv:2002.05229},
  year   = {2020}
}

备注

on Deep Reinforcement Learning workshop at NeurIPS 2019