基于策略切换的马尔可夫决策过程在线策略迭代
最优化与控制
2021-12-07 v1
摘要
受 Bertsekas 近期关于在在线设定下求解无限 horizon 折扣马尔可夫决策过程(MDPs)的策略迭代(PI)研究启发,我们开发了结合策略切换多策略改进方法的离线 PI,并将其异步变体改造为随时间生成策略序列的在线 PI 算法。当前策略仅于当前状态切换动作而更新为下一策略,同时确保序列中策略值函数的单调性。依据 MDP 的状态转移结构,该序列在有限时间内收敛到关联局部 MDP 的最优策略。当 MDP 为连通时,序列收敛到原始 MDP 的最优策略。
引用
@article{arxiv.2112.02177,
title = {On-line Policy Iteration with Policy Switching for Markov Decision Processes},
author = {Hyeong Soo Chang},
journal= {arXiv preprint arXiv:2112.02177},
year = {2021}
}