中文

强化学习:UCB 与替代自适应策略的比较

机器学习 2019-09-16 v1 人工智能 机器学习

摘要

在本文中,我们考虑强化学习(RL)的基本版本,其涉及为转移概率未知的马尔可夫决策过程计算最优数据驱动(自适应)策略。我们简要综述该领域现状,并将\cc{bkmdp97}的经典UCB策略与本文提出的称为MDP-确定性最小经验散度(MDP-DMED)的新策略以及基于后验采样的方法(MDP-PS)的性能进行比较。

关键词

引用

@article{arxiv.1909.06019,
  title  = {Reinforcement Learning: a Comparison of UCB Versus Alternative Adaptive Policies},
  author = {Wesley Cowan and Michael N. Katehakis and Daniel Pirutinsky},
  journal= {arXiv preprint arXiv:1909.06019},
  year   = {2019}
}