中文

强化学习算法选择

机器学习 2017-11-16 v3 人工智能 机器学习 最优化与控制

摘要

本文形式化了强化学习背景下的在线算法选择问题。设置如下:给定一个回合制任务和有限数量的离策略RL算法,一个元算法必须决定在下一个回合中由哪个RL算法控制,以最大化期望回报。文章提出了一种新颖的元算法,称为Epochal Stochastic Bandit Algorithm Selection (ESBAS)。其原理是在每个时段冻结策略更新,并让一个重启的stochastic bandit负责算法选择。在一些假设下,深入的理论分析证明了其在结构采样预算限制下的近最优性。ESBAS首先在一个对话任务上进行了经验评估,表明其在大多数配置下优于每个单独算法。随后ESBAS被适配到真正的在线设置中,算法在每次转移后更新其策略,我们称之为SSBAS。SSBAS在一个水果收集任务上评估,显示其比经典的双曲衰减更有效地调整步长参数,并在一个Atari游戏上大幅提升了性能。

关键词

引用

@article{arxiv.1701.08810,
  title  = {Reinforcement Learning Algorithm Selection},
  author = {Romain Laroche and Raphael Feraud},
  journal= {arXiv preprint arXiv:1701.08810},
  year   = {2017}
}