中文

鲁棒马尔可夫决策过程的渐近稳定性理论理解:样本复杂度与渐近性

机器学习 2022-08-16 v3 机器学习

摘要

本文研究鲁棒马尔可夫决策过程(MDPs)的最优鲁棒策略与值函数的非渐近与渐近性能,其中最优鲁棒策略与值函数仅从生成模型中求解。已有关于鲁棒 MDP 非渐近性能的工作局限于 KL 不确定性集与 (s,a)(s,a)-矩形假设的设置,我们改进了其结果,并考虑了其他不确定性集,包括 L1L_1χ2\chi^2 球。我们的结果表明,当对不确定性集假设 (s,a)(s,a)-矩形时,样本复杂度约为 O~(S2Aε2ρ2(1γ)4)\widetilde{O}\left(\frac{|\mathcal{S}|^2|\mathcal{A}|}{\varepsilon^2\rho^2(1-\gamma)^4}\right)。此外,我们将结果从 (s,a)(s,a)-矩形假设推广到 ss-矩形假设。在此情形下,样本复杂度随不确定性集的选择而变化,且通常大于 (s,a)(s,a)-矩形假设下的情形。而且,我们从理论与经验两方面均表明,在 (s,a)(s,a)ss-矩形假设下,最优鲁棒值函数以典型速率 n\sqrt{n} 渐近正态。

关键词

引用

@article{arxiv.2105.03863,
  title  = {Towards Theoretical Understandings of Robust Markov Decision Processes: Sample Complexity and Asymptotics},
  author = {Wenhao Yang and Liangyu Zhang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:2105.03863},
  year   = {2022}
}