鲁棒马尔可夫决策过程的渐近稳定性理论理解:样本复杂度与渐近性
机器学习
2022-08-16 v3 机器学习
摘要
本文研究鲁棒马尔可夫决策过程(MDPs)的最优鲁棒策略与值函数的非渐近与渐近性能,其中最优鲁棒策略与值函数仅从生成模型中求解。已有关于鲁棒 MDP 非渐近性能的工作局限于 KL 不确定性集与 -矩形假设的设置,我们改进了其结果,并考虑了其他不确定性集,包括 与 球。我们的结果表明,当对不确定性集假设 -矩形时,样本复杂度约为 。此外,我们将结果从 -矩形假设推广到 -矩形假设。在此情形下,样本复杂度随不确定性集的选择而变化,且通常大于 -矩形假设下的情形。而且,我们从理论与经验两方面均表明,在 与 -矩形假设下,最优鲁棒值函数以典型速率 渐近正态。
引用
@article{arxiv.2105.03863,
title = {Towards Theoretical Understandings of Robust Markov Decision Processes: Sample Complexity and Asymptotics},
author = {Wenhao Yang and Liangyu Zhang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2105.03863},
year = {2022}
}