基于广义控制障碍函数的模型化约束强化学习
机器人学
2021-03-08 v2 机器学习
摘要
模型信息可用于预测未来轨迹,因此在自动驾驶等真实世界任务中实施强化学习(RL)时,具有避免危险区域的巨大潜力。然而,现有研究多使用无模型约束 RL,导致不可避免的约束违例。本文提出一种模型化的约束 RL 可行性增强技术,利用定义在到约束边界距离上的广义控制障碍函数(GCBF)增强策略的可行性。通过使用模型信息,策略可在不违反实际安全约束的情况下安全优化,且样本效率得到提升。求解约束策略梯度中不可行的主要困难由自适应系数机制处理。我们在复杂自动驾驶避撞任务的仿真与真实车辆实验中评估了所提方法。相比基线约束 RL 方法,所提方法约束违例最多减少至四分之一,且收敛速度快 3.36 倍。
引用
@article{arxiv.2103.01556,
title = {Model-based Constrained Reinforcement Learning using Generalized Control Barrier Function},
author = {Haitong Ma and Jianyu Chen and Shengbo Eben Li and Ziyu Lin and Yang Guan and Yangang Ren and Sifa Zheng},
journal= {arXiv preprint arXiv:2103.01556},
year = {2021}
}