基于可达性分析与多项式 Zonotope 的动作投影可证明安全强化学习
机器人学
2023-03-15 v2 机器学习
系统与控制
系统与控制
摘要
尽管强化学习在许多应用中产生了非常有前景的结果,其主要缺点在于缺乏安全性保证,这阻碍了其在安全关键系统中的使用。在本工作中,我们通过针对求解可达-回避任务的非线性连续系统的安全屏蔽来解决此问题。我们的安全屏蔽通过将提议动作投影到最接近的安全动作,来防止施加来自强化学习智能体的潜在不安全动作。该方法称为动作投影,并通过混合整数优化实现。动作投影的安全约束由使用多项式 zonotope 的参数化可达性分析获得,其能够准确捕捉动作对系统的非线性影响。与其他最先进的动作投影方法相比,我们的安全屏蔽可有效处理输入约束与动态障碍物,简化机器人空间维度纳入安全约束的过程,在存在过程噪声与测量误差时保证鲁棒安全性,并且非常适用于高维系统,正如我们在若干具挑战性的基准系统上所展示的。
引用
@article{arxiv.2210.10691,
title = {Provably Safe Reinforcement Learning via Action Projection using Reachability Analysis and Polynomial Zonotopes},
author = {Niklas Kochdumper and Hanna Krasowski and Xiao Wang and Stanley Bak and Matthias Althoff},
journal= {arXiv preprint arXiv:2210.10691},
year = {2023}
}