马尔可夫决策过程最优阈值策略的在线强化学习
机器学习
2021-08-24 v3 机器学习
摘要
为克服动态规划(DP)方法求解马尔可夫决策过程(MDP)问题的维数灾与建模困难,实践中常采用强化学习(RL)方法。与不考虑最优策略结构特性的传统 RL 算法不同,我们提出一种结构感知学习算法,以利用最优策略(若存在)的有序多阈值结构。我们证明了所提算法渐近收敛于最优策略。由于策略空间的缩减,所提算法相较经典 RL 算法在存储与计算复杂度上均有显著改善。仿真结果表明,所提算法比其他 RL 算法收敛更快。
引用
@article{arxiv.1912.10325,
title = {Online Reinforcement Learning of Optimal Threshold Policies for Markov Decision Processes},
author = {Arghyadip Roy and Vivek Borkar and Abhay Karandikar and Prasanna Chaporkar},
journal= {arXiv preprint arXiv:1912.10325},
year = {2021}
}