中文

面向连续 MDP 的经验动态规划算法

最优化与控制 2019-04-25 v2

摘要

我们针对马尔可夫决策过程提出了通用的、基于随机函数近似的经验值迭代(EVI)算法。其“经验”特性源于每次迭代均基于下一状态模拟所得样本经验地进行。这使得 Bellman 算子成为随机算子。随后,将分别使用参数化函数空间和再生核 Hilbert 空间(RKHS)的参数化与非参数化函数近似方法与 EVI 相结合。这两种函数空间均具备通用函数近似性质。基函数被随机选取。收敛分析采用随机算子框架并结合随机优势理论的技术进行。为两种通用近似动态规划算法推导了有限时间样本复杂度界限。数值实验支持了该方法的通用性与有效性。

关键词

引用

@article{arxiv.1709.07506,
  title  = {An Empirical Dynamic Programming Algorithm for Continuous MDPs},
  author = {William B. Haskell and Rahul Jain and Hiteshi Sharma and Pengqian Yu},
  journal= {arXiv preprint arXiv:1709.07506},
  year   = {2019}
}

备注

Accepted for publication in IEEE Transactions on Automatic Control