中文

状态增广约束强化学习:克服基于奖励学习的局限性

机器学习 2023-09-22 v2 机器人学 最优化与控制

摘要

约束强化学习的一种常见表述涉及多个奖励,这些奖励必须各自累积到给定阈值。在这类问题中,我们展示了一个简单示例,其中所需的最优策略无法由任意加权线性组合的奖励诱导产生。因此,存在约束强化学习问题,无论是正则化方法还是经典的原始对偶方法都无法产生最优策略。本工作通过将状态与拉格朗日乘子增广,并将原始对偶方法重新解释为驱动乘子演化的动力学部分,来解决这一缺陷。该方法提供了一种系统的状态增广过程,保证能求解带约束的强化学习问题。因此,正如我们以一个示例所说明的,尽管先前的方法可能找不到最优策略,但在执行增广策略的同时运行对偶动力学,会产生一种可证明从最优策略中采样动作的算法。

关键词

引用

@article{arxiv.2102.11941,
  title  = {State Augmented Constrained Reinforcement Learning: Overcoming the Limitations of Learning with Rewards},
  author = {Miguel Calvo-Fullana and Santiago Paternain and Luiz F. O. Chamon and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:2102.11941},
  year   = {2023}
}