中文

基于策略切换的马尔可夫决策过程在线策略迭代

最优化与控制 2021-12-07 v1

摘要

受 Bertsekas 近期关于在在线设定下求解无限 horizon 折扣马尔可夫决策过程(MDPs)的策略迭代(PI)研究启发,我们开发了结合策略切换多策略改进方法的离线 PI,并将其异步变体改造为随时间生成策略序列的在线 PI 算法。当前策略仅于当前状态切换动作而更新为下一策略,同时确保序列中策略值函数的单调性。依据 MDP 的状态转移结构,该序列在有限时间内收敛到关联局部 MDP 的最优策略。当 MDP 为连通时,序列收敛到原始 MDP 的最优策略。

关键词

引用

@article{arxiv.2112.02177,
  title  = {On-line Policy Iteration with Policy Switching for Markov Decision Processes},
  author = {Hyeong Soo Chang},
  journal= {arXiv preprint arXiv:2112.02177},
  year   = {2021}
}