一种用于约束马尔可夫决策过程的可证明高效无模型算法
机器学习
2021-10-26 v2 人工智能
摘要
本文提出了首个用于约束马尔可夫决策过程(CMDPs)的无模型、无模拟器的强化学习算法,具有次线性后悔和零约束违反。该算法命名为 Triple-Q,因为它包含三个关键组件:用于累积奖励的 Q 函数(也称为动作值函数)、用于约束累积效用的 Q 函数,以及一个(过高)估计累积约束违反的虚拟队列。在 Triple-Q 下,每一步根据伪 Q 值选择动作,伪 Q 值是三个“Q”值的组合。算法以依赖于对应(状态,动作)对访问次数并周期性重置的学习率来更新奖励和效用 Q 值。在分段式 CMDP 设定下,Triple-Q 实现了 的后悔,其中 为总段数, 为每段步数, 为状态数, 为动作数, 为 Slater 常数。此外,当 足够大时,Triple-Q 在保证零约束违反方面,无论是在期望上还是以高概率,都得到保证。最后,Triple-Q 的计算复杂度与无约束 MDPs 的 SARSA 相似,且具有计算高效性。
引用
@article{arxiv.2106.01577,
title = {A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes},
author = {Honghao Wei and Xin Liu and Lei Ying},
journal= {arXiv preprint arXiv:2106.01577},
year = {2021}
}