中文

关于强化学习中蒙特卡洛探索起点算法的收敛性

机器学习 2022-08-08 v2 人工智能 机器学习

摘要

强化学习(RL)中一个简单自然的算法是蒙特卡洛探索起点(MCES),其中Q函数通过平均蒙特卡洛回报来估计,策略通过选择使当前Q函数估计最大化的动作来改进。探索通过“探索起点”实现,即每一幕从一个随机选取的状态和动作开始,然后遵循当前策略直至终止状态。在Sutton & Barto (2018)的RL经典著作中,指出确立MCES算法的收敛性是RL中最重要的未解决理论问题之一。然而,MCES的收敛问题实则相当微妙。Bertsekas & Tsitsiklis (1996)给出一个反例表明MCES算法未必收敛。Tsitsiklis (2002)进一步证明,若对原始MCES算法进行修改,使所有状态-动作对的Q函数估计以相同速率更新,且折扣因子严格小于1,则MCES算法收敛。本文在Sutton & Barto (1998)给出的原始且更高效的MCES算法上取得进展,确立了最优策略前馈MDP的几乎必然收敛性,此类MDP指在使用最优策略时任一幕内状态不被重复访问的MDP。这类MDP包含一大类环境,如所有确定性环境以及所有带有时间步或任何单调变化值作为状态一部分的情节式环境。不同于以往使用随机近似的证明,我们引入一种新颖的归纳法,其非常简单且仅用到强大数定律。

关键词

引用

@article{arxiv.2002.03585,
  title  = {On the Convergence of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning},
  author = {Che Wang and Shuhan Yuan and Kai Shao and Keith Ross},
  journal= {arXiv preprint arXiv:2002.03585},
  year   = {2022}
}

备注

The Tenth International Conference on Learning Representations. ICLR 2022. 33 pages