中文

ε-BMC:无模型强化学习中 epsilon-greedy 探索的贝叶斯集成方法

机器学习 2020-07-03 v1 机器人学 机器学习

摘要

解决探索-利用权衡仍是强化学习(RL)算法设计与实现中的一个基本问题。本文关注使用 epsilon-greedy 探索策略的无模型 RL,该策略尽管简单,却仍是最常用的探索形式之一。然而,该策略的一个关键局限在于 ε 的设定。本文从贝叶斯的新视角将 ε 视为 Q 值函数均匀性的度量。基于这一新视角,我们引入了基于贝叶斯模型组合(BMC)的闭式贝叶斯模型更新,使得我们能够利用环境经验在常数时间内自适应调整 ε,并具有单调收敛保证。我们证明了所提出的算法 ε-BMC 在不同问题上高效地平衡了探索与利用,性能与最优调参的固定退火调度相当或更优,并且优于文献中提出的另一种数据依赖的 ε 自适应方案。

关键词

引用

@article{arxiv.2007.00869,
  title  = {{\epsilon}-BMC: A Bayesian Ensemble Approach to Epsilon-Greedy Exploration in Model-Free Reinforcement Learning},
  author = {Michael Gimelfarb and Scott Sanner and Chi-Guhn Lee},
  journal= {arXiv preprint arXiv:2007.00869},
  year   = {2020}
}

备注

Published in UAI 2019