中文

面向具有非平稳目标与约束的 CMDP 的可证明高效原始对偶强化学习

机器学习 2022-11-22 v4

摘要

我们考虑在具有非平稳目标与约束的情节式约束马尔可夫决策过程(CMDPs)中基于原始对偶的强化学习(RL),其在确保时变环境中 RL 安全性方面起核心作用。该问题中,奖励/效用函数与状态转移函数均允许随时间任意变化,只要其累积变化不超过特定已知变化预算。在时变环境中设计安全 RL 算法尤为困难,因为需要整合约束违反削减、安全探索以及对非平稳性的适应。为此,我们识别出关于时变约束的两个可保证长期安全的替代条件。我们还提出可协调这两种条件的周期性重启乐观原始对偶近端策略优化(PROPD-PPO)算法。此外,在两种替代条件下,针对所提算法在线性核 CMDP 函数逼近设定与表格 CMDP 设定中均建立了动态后悔界与约束违反界。本文提供了首个针对非平稳 CMDP 且具有安全探索的可证明高效算法。

关键词

引用

@article{arxiv.2201.11965,
  title  = {Provably Efficient Primal-Dual Reinforcement Learning for CMDPs with Non-stationary Objectives and Constraints},
  author = {Yuhao Ding and Javad Lavaei},
  journal= {arXiv preprint arXiv:2201.11965},
  year   = {2022}
}

备注

32 pages, AAAI 2023