强化学习:UCB 与替代自适应策略的比较
机器学习
2019-09-16 v1 人工智能
机器学习
摘要
在本文中,我们考虑强化学习(RL)的基本版本,其涉及为转移概率未知的马尔可夫决策过程计算最优数据驱动(自适应)策略。我们简要综述该领域现状,并将\cc{bkmdp97}的经典UCB策略与本文提出的称为MDP-确定性最小经验散度(MDP-DMED)的新策略以及基于后验采样的方法(MDP-PS)的性能进行比较。
引用
@article{arxiv.1909.06019,
title = {Reinforcement Learning: a Comparison of UCB Versus Alternative Adaptive Policies},
author = {Wesley Cowan and Michael N. Katehakis and Daniel Pirutinsky},
journal= {arXiv preprint arXiv:1909.06019},
year = {2019}
}