中文

一种用于带约束情节式有限时域 MDP 的样本高效算法

机器学习 2020-09-25 v1 人工智能 系统与控制 系统与控制 机器学习

摘要

约束马尔可夫决策过程(CMDPs)将序贯决策问题形式化,其目标是在满足各种代价函数约束的同时最小化一个代价函数。在本文中,我们考虑情节式固定时域 CMDP 的设置。我们提出一种在线算法,其利用有限时域 CMDP 的线性规划公式进行重复乐观规划,从而对确保 ϵ\epsilon-最优策略所需的情节数提供可能近似正确(PAC)保证,即以至少 1δ1-\delta 的概率,使所得目标值在最优值的 ϵ\epsilon 范围内且满足约束在 ϵ\epsilon 容差内。所需情节数被证明为 O~(SAC2H2ϵ2log1δ)\tilde{\mathcal{O}}\big(\frac{|S||A|C^{2}H^{2}}{\epsilon^{2}}\log\frac{1}{\delta}\big) 阶,其中 CC 为一个状态-动作对的可能后继状态数的上界。因此,若 CSC \ll |S|,所需情节数对状态空间大小 S|S| 和动作空间大小 A|A| 分别具有线性依赖,对时间时域 HH 具有二次依赖。

关键词

引用

@article{arxiv.2009.11348,
  title  = {A Sample-Efficient Algorithm for Episodic Finite-Horizon MDP with Constraints},
  author = {Krishna C. Kalagarla and Rahul Jain and Pierluigi Nuzzo},
  journal= {arXiv preprint arXiv:2009.11348},
  year   = {2020}
}