中文

基于策略迭代的蒙特卡洛策略评估强化学习收敛性研究

机器学习 2023-03-01 v2 人工智能 系统与控制 系统与控制

摘要

强化学习中的一种常用技术是从给定策略的蒙特卡洛模拟评估价值函数,并利用估计的价值函数获得相对于估计价值函数贪婪的新策略。此背景下一个著名的长期开放问题是证明当策略的价值函数由执行该策略所得的单一样本路径数据估计时此类方案的收敛性(见 [Sutton and Barto, 2018] 第 99 页、[Tsitsiklis, 2002] 第 8 页)。我们通过证明此类策略迭代方案的首访版本在使用 lookahead [Silver et al., 2016, Mnih et al., 2016, Silver et al., 2017b] 而非简单贪婪策略改进的策略改进步骤时确实收敛到最优策略,给出了该开放问题的解。我们给出了表格设定下原始开放问题的结果,并推广到函数近似设定,其中我们表明算法所得策略在函近似误差范围内接近最优策略。

关键词

引用

@article{arxiv.2301.09709,
  title  = {On The Convergence Of Policy Iteration-Based Reinforcement Learning With Monte Carlo Policy Evaluation},
  author = {Anna Winnicki and R. Srikant},
  journal= {arXiv preprint arXiv:2301.09709},
  year   = {2023}
}

备注

27 pages