CMDP 中离屏策略学习的近最优原始对偶方法
机器学习
2022-07-14 v1 人工智能
机器学习
摘要
作为安全强化学习的重要框架,约束马尔可夫决策过程(CMDP)在近期文献中已被广泛研究。然而,尽管在各种在策略学习设定下已有丰富结果,对于离屏 CMDP 问题,无论在算法设计还是信息论样本复杂度下界方面,仍缺乏一些本质理解。在本文中,我们专注于求解仅可获取离屏数据的 CMDP 问题。通过采用单策略可集中系数 的概念,我们建立了离屏 CMDP 问题的 样本复杂度下界,其中 表示约束的数量。通过引入一种简单而新颖的偏差控制机制,我们提出了一种称为 DPDL 的近最优原始对偶学习算法。该算法可证明保证零约束违反,且其样本复杂度除一个 因子外与上述下界匹配。文中还包含关于如何处理未知常数 以及离屏数据集上潜在异步结构的全面讨论。
引用
@article{arxiv.2207.06147,
title = {A Near-Optimal Primal-Dual Method for Off-Policy Learning in CMDP},
author = {Fan Chen and Junyu Zhang and Zaiwen Wen},
journal= {arXiv preprint arXiv:2207.06147},
year = {2022}
}