一种用于带约束情节式有限时域 MDP 的样本高效算法
机器学习
2020-09-25 v1 人工智能
系统与控制
系统与控制
机器学习
摘要
约束马尔可夫决策过程(CMDPs)将序贯决策问题形式化,其目标是在满足各种代价函数约束的同时最小化一个代价函数。在本文中,我们考虑情节式固定时域 CMDP 的设置。我们提出一种在线算法,其利用有限时域 CMDP 的线性规划公式进行重复乐观规划,从而对确保 -最优策略所需的情节数提供可能近似正确(PAC)保证,即以至少 的概率,使所得目标值在最优值的 范围内且满足约束在 容差内。所需情节数被证明为 阶,其中 为一个状态-动作对的可能后继状态数的上界。因此,若 ,所需情节数对状态空间大小 和动作空间大小 分别具有线性依赖,对时间时域 具有二次依赖。
引用
@article{arxiv.2009.11348,
title = {A Sample-Efficient Algorithm for Episodic Finite-Horizon MDP with Constraints},
author = {Krishna C. Kalagarla and Rahul Jain and Pierluigi Nuzzo},
journal= {arXiv preprint arXiv:2009.11348},
year = {2020}
}