中文

一种面向约束马尔可夫决策过程的安全探索方法

机器学习 2025-03-04 v3 最优化与控制

摘要

我们考虑折扣无限时域约束马尔可夫决策过程(CMDPs),其目标是找到在满足期望累积约束的同时最大化期望累积奖励的最优策略。受 CMDPs 在安全关键系统在线学习中应用的推动,我们致力于开发一种无模型且\emph{无模拟器}的算法,以确保\emph{学习过程中的约束满足}。为此,我们采用 \cite{usmanova2022log} 中提出的 LB-SGD 算法,该算法利用基于 CMDP 对数障碍函数(log-barrier function)的内点法。在通常假设的松弛 Fisher 非退化性和策略参数化中有界转移误差条件下,我们建立了 LB-SGD 算法的理论性质。特别地,与现有仅在收敛时保证策略可行性的 CMDP 方法不同,LB-SGD 算法在整个学习过程中保证可行性,并以 O~(ε6)\tilde{\mathcal{O}}(\varepsilon^{-6}) 的样本复杂度收敛到 ε\varepsilon-最优策略。与最先进的基于策略梯度的算法 C-NPG-PDA \cite{bai2022achieving2} 相比,LB-SGD 算法在相同 Fisher 非退化参数化下,为确保在学习过程中策略可行性需额外消耗 O(ε2)\mathcal{O}(\varepsilon^{-2}) 个样本。

关键词

引用

@article{arxiv.2312.00561,
  title  = {A safe exploration approach to constrained Markov decision processes},
  author = {Tingting Ni and Maryam Kamgarpour},
  journal= {arXiv preprint arXiv:2312.00561},
  year   = {2025}
}

备注

37 pages, 3 figures