中文

无限 horizon 折扣奖励马尔可夫决策过程下一般参数化自然策略梯度算法的改进样本复杂度分析

机器学习 2024-02-06 v2 人工智能

摘要

我们考虑为无限 horizon 折扣奖励马尔可夫决策过程设计样本高效学习算法的问题。具体而言,我们提出加速自然策略梯度(Accelerated Natural Policy Gradient, ANPG)算法,该算法利用加速随机梯度下降过程来获得自然策略梯度。ANPG 在一般参数化下实现了 O(ϵ2)\mathcal{O}({\epsilon^{-2}}) 的样本复杂度和 O(ϵ1)\mathcal{O}(\epsilon^{-1}) 的迭代复杂度,其中 ϵ\epsilon 定义了最优性误差。这比最先进的样本复杂度改进了 log(1ϵ)\log(\frac{1}{\epsilon}) 因子。ANPG 是一种一阶算法,并且与一些现有文献不同,不需要重要性采样(IS)权重的方差有上界这一不可验证的假设。在无 Hessian 且无 IS 的算法类别中,ANPG 以 O(ϵ12)\mathcal{O}(\epsilon^{-\frac{1}{2}}) 的因子优于已知最佳样本复杂度,同时与其最先进的迭代复杂度相匹配。

关键词

引用

@article{arxiv.2310.11677,
  title  = {Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes},
  author = {Washim Uddin Mondal and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2310.11677},
  year   = {2024}
}