中文

用于分布式深度探索的策略袋

机器学习 2023-08-04 v1

摘要

在复杂环境中高效探索仍是强化学习(RL)的一大挑战。与先前受 Thompson 采样启发、能够实现时间扩展探索(即深度探索)的机制相比,我们关注分布式 RL 中的深度探索。我们在此开发了一种通用方法——策略袋(BoP),它可构建于任何回报分布估计器之上,通过维护其多个副本的种群来实现。BoP 由多个独立更新的头组成的集成构成。在训练期间,每一幕仅由一个头控制,所收集的状态-动作对被用于离策更新所有头,从而为每个头带来不同的学习信号,使学习和行为多样化。为检验乐观集成方法能否像在标量 RL(例如 Bootstrapped DQN)中那样改进分布式 RL,我们通过使用贝叶斯分布式策略梯度(BDPG)的一组分布式 actor-critic 来实现 BoP 方法。该种群由此近似回报分布的 posterior 分布以及策略的 posterior 分布。构建于 BDPG 之上的另一益处是,它允许同时分析全局 posterior 不确定性与局部好奇心奖励以进行探索。由于 BDPG 本身已是一种乐观方法,该组合有助于研究在分布式 RL 中乐观是否可累积。总体而言,正如我们在 ALE Atari 游戏上的实验结果所展示的,BoP 在学习过程中带来了更强的鲁棒性与更快的速度。

关键词

引用

@article{arxiv.2308.01759,
  title  = {Bag of Policies for Distributional Deep Exploration},
  author = {Asen Nachkov and Luchen Li and Giulia Luise and Filippo Valdettaro and Aldo Faisal},
  journal= {arXiv preprint arXiv:2308.01759},
  year   = {2023}
}