POMDP 下 Natural Actor-Critic 的有限时间分析
机器学习
2023-07-20 v3 最优化与控制
机器学习
摘要
我们考虑具有大型甚至可数无限状态空间的部分观测马尔可夫决策过程(POMDPs)的强化学习问题,其中控制器只能访问底层受控马尔可夫链的有噪观测。我们考虑一种 natural actor-critic 方法,该方法采用有限内部记忆进行策略参数化,并采用多步时序差分学习算法进行策略评估。据我们所知,我们建立了在函数近似下部分观测系统 actor-critic 方法的首个非渐近全局收敛性。特别地,除了在 MDPs 中同样出现的函数近似误差与统计误差外,我们显式刻画了因使用有限状态控制器而产生的误差。该附加误差以 POMDPs 中传统信念状态与使用有限状态控制器时隐状态后验分布之间的总变距离表示。进一步,我们表明在滑动块控制器情形下,通过使用更大的块尺寸可使该误差变小。
引用
@article{arxiv.2202.09753,
title = {Finite-Time Analysis of Natural Actor-Critic for POMDPs},
author = {Semih Cayci and Niao He and R. Srikant},
journal= {arXiv preprint arXiv:2202.09753},
year = {2023}
}