中文

基于蒙特卡洛树学习的策略梯度算法及其在非马尔可夫决策过程中的应用

机器学习 2024-07-08 v2 人工智能

摘要

策略梯度(PG)是一种强化学习(RL)方法,它通过梯度上升优化参数化策略模型以最大化期望回报。虽然 PG 即使在非马尔可夫环境中也能表现良好,但可能会遇到平台期或峰值问题。作为另一种成功的 RL 方法,基于蒙特卡洛树搜索(MCTS)的算法(包括 AlphaZero)已取得突破性成果,尤其在博弈领域。它们在应用于非马尔可夫决策过程时同样有效。然而,标准 MCTS 是一种决策时规划方法,与在线 RL 设定不同。在本工作中,我们首先引入蒙特卡洛树学习(MCTL),即 MCTS 面向在线 RL 设定的适配版本。随后我们探索 PG 与 MCTL 相结合的混合策略方法,以发挥二者优势。我们利用双时间尺度随机逼近的结果推导了渐近收敛条件,并提出了一种满足这些条件且收敛到合理解的算法。我们的数值实验验证了所提方法的有效性。

关键词

引用

@article{arxiv.2206.01011,
  title  = {Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes},
  author = {Tetsuro Morimura and Kazuhiro Ota and Kenshi Abe and Peinan Zhang},
  journal= {arXiv preprint arXiv:2206.01011},
  year   = {2024}
}

备注

Accepted to Reinforcement Learning Conference (RLC) 2024