中文

分位数约束强化学习:一种约束中断概率的强化学习框架

机器学习 2022-11-29 v1 人工智能

摘要

约束强化学习(RL)是强化学习的一个领域,其目标是找到一个最优策略,在满足给定约束的同时最大化期望累积回报。以往大多数约束强化学习工作将期望累积和代价作为约束。然而,以该约束进行优化无法保证累积和代价超过给定阈值的中断事件的目标概率。本文提出一个名为分位数约束强化学习(QCRL)的框架,用以约束累积和代价分布的分位数,这是满足中断约束的充要条件。这是首个解决将策略梯度定理应用于分位数的问题,并为近似分位数梯度提供理论结果的工作。基于推导出的理论结果和拉格朗日乘子技术,我们构建了一个名为分位数约束策略优化(QCPO)的约束强化学习算法。我们使用结合大偏差原理(LDP)的分布强化学习来估计累积和代价的分位数和尾部概率,以实现 QCPO。所实现的算法在训练期后满足中断概率约束。

关键词

引用

@article{arxiv.2211.15034,
  title  = {Quantile Constrained Reinforcement Learning: A Reinforcement Learning Framework Constraining Outage Probability},
  author = {Whiyoung Jung and Myungsik Cho and Jongeui Park and Youngchul Sung},
  journal= {arXiv preprint arXiv:2211.15034},
  year   = {2022}
}

备注

NeurIPS 2022