中文

基于分离比例-积分拉格朗日的模型机会约束强化学习

机器学习 2021-08-27 v1 机器人学 系统与控制 系统与控制

摘要

安全性对于应用于真实世界的强化学习 (RL) 至关重要。添加机会约束(或概率约束)是在不确定性下增强 RL 安全性的合适方法。现有的机会约束 RL 方法(如惩罚方法和拉格朗日方法)要么表现出周期性振荡,要么学习到过度保守或不安全的策略。在本文中,我们通过提出一种分离比例-积分拉格朗日 (SPIL) 算法来解决这些缺陷。我们首先从反馈控制的角度回顾约束策略优化过程,将惩罚权重视为控制输入,将安全概率视为控制输出。基于此,惩罚方法被表述为比例控制器,拉格朗日方法被表述为积分控制器。然后我们统一它们并提出一种比例-积分拉格朗日方法以获得两者的优点,同时使用积分分离技术将积分值限制在合理范围内。为了加速训练,以基于模型的方式计算安全概率的梯度。我们证明了在车辆跟驰仿真中,我们的方法可以减少 RL 策略的振荡和保守性。为了证明其实用性,我们还将我们的方法应用于真实世界的移动机器人导航任务,其中我们的机器人成功避开了具有高度不确定甚至激进行为的移动障碍物。

关键词

引用

@article{arxiv.2108.11623,
  title  = {Model-based Chance-Constrained Reinforcement Learning via Separated Proportional-Integral Lagrangian},
  author = {Baiyu Peng and Jingliang Duan and Jianyu Chen and Shengbo Eben Li and Genjin Xie and Congsheng Zhang and Yang Guan and Yao Mu and Enxin Sun},
  journal= {arXiv preprint arXiv:2108.11623},
  year   = {2021}
}