用于机会约束强化学习的分离比例-积分拉格朗日方法
机器学习
2021-02-18 v1 人工智能
系统与控制
系统与控制
摘要
安全性对于应用于自动驾驶等现实任务的强化学习(RL)至关重要。以高概率保证状态约束得到满足的机会约束,适合表示具有不确定性的现实环境中的要求。现有的机会约束 RL 方法如惩罚方法和拉格朗日方法,要么表现出周期性振荡,要么无法满足约束。本文中,我们通过提出一种分离比例-积分拉格朗日(SPIL)算法来解决这些缺陷。从控制视角出发,我们首先将惩罚方法和拉格朗日方法分别解释为比例反馈和积分反馈控制。然后,提出一种比例-积分拉格朗日方法以稳定学习过程同时提升安全性。为防止积分超调并降低保守性,我们引入了受 PID 控制启发的积分分离技术。最后,利用机会约束的解析梯度进行基于模型的策略优化。SPIL 的有效性通过一个狭窄跟车任务得到验证。实验表明,与先前方法相比,SPIL 在保证安全性的同时提升了性能,且学习过程平稳。
引用
@article{arxiv.2102.08539,
title = {Separated Proportional-Integral Lagrangian for Chance Constrained Reinforcement Learning},
author = {Baiyu Peng and Yao Mu and Jingliang Duan and Yang Guan and Shengbo Eben Li and Jianyu Chen},
journal= {arXiv preprint arXiv:2102.08539},
year = {2021}
}