中文

一种用于约束马尔可夫决策过程的可证明高效无模型算法

机器学习 2021-10-26 v2 人工智能

摘要

本文提出了首个用于约束马尔可夫决策过程(CMDPs)的无模型、无模拟器的强化学习算法,具有次线性后悔和零约束违反。该算法命名为 Triple-Q,因为它包含三个关键组件:用于累积奖励的 Q 函数(也称为动作值函数)、用于约束累积效用的 Q 函数,以及一个(过高)估计累积约束违反的虚拟队列。在 Triple-Q 下,每一步根据伪 Q 值选择动作,伪 Q 值是三个“Q”值的组合。算法以依赖于对应(状态,动作)对访问次数并周期性重置的学习率来更新奖励和效用 Q 值。在分段式 CMDP 设定下,Triple-Q 实现了 O~(1δH4S12A12K45)\tilde{\cal O}\left(\frac{1 }{\delta}H^4 S^{\frac{1}{2}}A^{\frac{1}{2}}K^{\frac{4}{5}} \right) 的后悔,其中 KK 为总段数,HH 为每段步数,SS 为状态数,AA 为动作数,δ\delta 为 Slater 常数。此外,当 KK 足够大时,Triple-Q 在保证零约束违反方面,无论是在期望上还是以高概率,都得到保证。最后,Triple-Q 的计算复杂度与无约束 MDPs 的 SARSA 相似,且具有计算高效性。

关键词

引用

@article{arxiv.2106.01577,
  title  = {A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes},
  author = {Honghao Wei and Xin Liu and Lei Ying},
  journal= {arXiv preprint arXiv:2106.01577},
  year   = {2021}
}