中文

面向对抗损失 CMDP 的上置信原始对偶强化学习

机器学习 2021-10-19 v3 最优化与控制 机器学习

摘要

我们考虑情景式随机约束马尔可夫决策过程(CMDPs)的在线学习,其在保障强化学习安全性方面起着核心作用。此处损失函数可在各情景间任意变化,且收到的损失与预算消耗均在每幕结束时揭示。先前工作在马尔可夫决策过程(MDPs)转移模型先验已知的严格假设下解决该问题,并建立了关于状态空间 S\mathcal{S} 与动作空间 A\mathcal{A} 基数多项式依赖的遗憾界。本工作中,我们提出一种新的上置信原始对偶(upper confidence primal-dual)算法,其仅需从转移模型采样的轨迹。特别地,我们证明所提算法实现了遗憾与约束违反的 O~(LSAT)\widetilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T}) 上界,其中 LL 为每幕长度。我们的分析将拉格朗日乘子过程的新高概率漂移分析融入著名的上置信强化学习遗憾分析中,展示了“面对不确定性保持乐观”在约束在线学习中的威力。

关键词

引用

@article{arxiv.2003.00660,
  title  = {Upper Confidence Primal-Dual Reinforcement Learning for CMDP with Adversarial Loss},
  author = {Shuang Qiu and Xiaohan Wei and Zhuoran Yang and Jieping Ye and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2003.00660},
  year   = {2021}
}