约束马尔可夫决策过程中拉格朗日方法的无抵消遗憾界
机器学习
2023-08-31 v2 机器学习
摘要
约束马尔可夫决策过程(CMDPs)是对安全强化学习问题进行建模的常用方式之一,其中约束函数对安全目标进行建模。基于拉格朗日的对偶或原对偶算法为在 CMDPs 中学习提供了高效方法。对于这些算法,当前在有限时域设定下已知的遗憾界允许“误差抵消”;即可以用某一回合中的严格约束满足来补偿另一回合中的约束违反。然而,在实际应用中我们并不认为这种行为是安全的。在本文中,我们通过提出一种新颖的基于模型的原对偶算法 OptAug-CMDP 来克服这一弱点,该算法适用于表格有限时域 CMDPs。我们的算法受增广拉格朗日方法启发,且可高效执行。我们表明,在对 CMDP 进行 回合探索期间,我们的算法在目标和约束违反上均获得了 的遗憾。与现有拉格朗日方法不同,我们的算法无需误差抵消即可实现此遗憾。
引用
@article{arxiv.2306.07001,
title = {Cancellation-Free Regret Bounds for Lagrangian Approaches in Constrained Markov Decision Processes},
author = {Adrian Müller and Pragnya Alatur and Giorgia Ramponi and Niao He},
journal= {arXiv preprint arXiv:2306.07001},
year = {2023}
}