基于蒙特卡洛探索初值的强化学习的收敛性
最优化与控制
2020-07-22 v1 机器学习
摘要
一种基本的基于仿真的强化学习算法是蒙特卡洛探索状态(MCES)方法,亦称乐观策略迭代,其中价值函数由仿真回报近似,并在每次迭代中选择贪婪策略。该算法在一般设定下的收敛性一直是一个开放问题。在本文中,我们研究该算法在无折扣代价(亦称随机最短路径问题)情形下的收敛性。结果补充了已有的关于该主题的部分结果,从而有助于进一步解决该开放问题。作为一个附带结果,我们也给出了随机逼近中常用的超鞅收敛定理某一版本的证明。
引用
@article{arxiv.2007.10916,
title = {On the Convergence of Reinforcement Learning with Monte Carlo Exploring Starts},
author = {Jun Liu},
journal= {arXiv preprint arXiv:2007.10916},
year = {2020}
}
备注
12 pages, 1 figure, preprint submitted for publication