中文

一种求解具有任意时刻对抗约束的在线 CMDP 的乐观算法

机器学习 2025-06-03 v1 人工智能

摘要

在线安全强化学习(RL)在动态环境中发挥着关键作用,应用于自动驾驶、机器人和网络安全等领域。其目标是学习最优策略,以在满足由受约束马尔可夫决策过程(CMDP)建模的安全约束的同时最大化奖励。现有方法在随机约束下实现了次线性遗憾,但在对抗环境中往往失效,其中约束是未知的、时变的且可能是对抗设计的。在本文中,我们提出了乐观镜像下降原始-对偶(OMDPD)算法,这是首个解决具有任意时刻对抗约束的在线 CMDP 的算法。OMDPD 实现了最优遗憾 O(K)O(\sqrt{K}) 和强约束违反 O(K)O(\sqrt{K}),且不依赖于 Slater 条件或严格已知安全策略的存在。我们进一步表明,获取奖励和转移的准确估计可以进一步改善这些界限。我们的结果为对抗环境中的安全决策提供了实用保证。

关键词

引用

@article{arxiv.2505.21841,
  title  = {An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints},
  author = {Jiahui Zhu and Kihyun Yu and Dabeen Lee and Xin Liu and Honghao Wei},
  journal= {arXiv preprint arXiv:2505.21841},
  year   = {2025}
}

备注

Proceedings of the 41 st International Conference on Machine Learning