中文

带峰值约束 MDP 的可证明高效无模型算法

最优化与控制 2022-06-15 v6 机器学习 系统与控制 系统与控制 机器学习

摘要

在动态系统优化中,变量通常带有约束。此类问题可建模为约束马尔可夫决策过程(CMDP)。本文考虑峰值约束马尔可夫决策过程(PCMDP),其中智能体选择策略以最大化有限时域内的总奖励,并以概率 1 在每个时刻满足约束。我们提出一种无模型算法,将 PCMDP 问题转化为无约束问题,并采用基于 Q-learning 的方法。我们针对所提 PCMDP 问题定义了可能近似正确(PAC)的概念。所提算法被证明在幕数 KΩ(I2H6SAϵ2)K\geq\Omega(\frac{I^2H^6SA\ell}{\epsilon^2}) 时达到 (ϵ,p)(\epsilon,p)-PAC 策略,其中 SSAA 分别为状态数与动作数,HH 为每幕的时刻数,II 为约束函数个数,且 =log(SATp)\ell=\log(\frac{SAT}{p})。我们注意到,这是关于具有峰值约束且转移动态先验未知的 PCMDP 的 PAC 类分析的首个结果。我们在一个能量收集问题与一台机器调度问题上展示了所提算法,其表现接近所研究优化问题的理论上界。

关键词

引用

@article{arxiv.2003.05555,
  title  = {Provably Efficient Model-Free Algorithm for MDPs with Peak Constraints},
  author = {Qinbo Bai and Vaneet Aggarwal and Ather Gattami},
  journal= {arXiv preprint arXiv:2003.05555},
  year   = {2022}
}