中文

ReLOAD:基于乐观升降的强化学习以实现约束MDP中的末次迭代收敛

机器学习 2023-03-07 v2

摘要

近年来,强化学习(RL)已越来越成功地应用于现实世界问题。此类应用通常要求对智能体行为施加约束。现有的约束强化学习(CRL)算法依赖梯度下降-上升,但该方法存在一个缺陷。尽管这些算法被保证平均收敛,它们并不保证末次迭代收敛,即智能体的当前策略可能永远不收敛到最优解。在实践中,常观察到策略在满足约束与最大化奖励之间交替,很少能同时达成两个目标。在此,我们通过引入乐观升降强化学习(ReLOAD)解决此问题,这是一种具有末次迭代收敛保证的、有原理依据的CRL方法。我们在包括离散MDP与连续控制在内的广泛CRL问题上展示了其经验有效性。在此过程中,我们建立了一个具有挑战性的CRL问题基准。

关键词

引用

@article{arxiv.2302.01275,
  title  = {ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs},
  author = {Ted Moskovitz and Brendan O'Donoghue and Vivek Veeriah and Sebastian Flennerhag and Satinder Singh and Tom Zahavy},
  journal= {arXiv preprint arXiv:2302.01275},
  year   = {2023}
}