带峰值约束 MDP 的可证明高效无模型算法
最优化与控制
2022-06-15 v6 机器学习
系统与控制
系统与控制
机器学习
摘要
在动态系统优化中,变量通常带有约束。此类问题可建模为约束马尔可夫决策过程(CMDP)。本文考虑峰值约束马尔可夫决策过程(PCMDP),其中智能体选择策略以最大化有限时域内的总奖励,并以概率 1 在每个时刻满足约束。我们提出一种无模型算法,将 PCMDP 问题转化为无约束问题,并采用基于 Q-learning 的方法。我们针对所提 PCMDP 问题定义了可能近似正确(PAC)的概念。所提算法被证明在幕数 时达到 -PAC 策略,其中 与 分别为状态数与动作数, 为每幕的时刻数, 为约束函数个数,且 。我们注意到,这是关于具有峰值约束且转移动态先验未知的 PCMDP 的 PAC 类分析的首个结果。我们在一个能量收集问题与一台机器调度问题上展示了所提算法,其表现接近所研究优化问题的理论上界。
引用
@article{arxiv.2003.05555,
title = {Provably Efficient Model-Free Algorithm for MDPs with Peak Constraints},
author = {Qinbo Bai and Vaneet Aggarwal and Ather Gattami},
journal= {arXiv preprint arXiv:2003.05555},
year = {2022}
}