值函数即控制障碍函数:基于控制理论的安全策略验证
机器学习
2023-12-06 v4 人工智能
机器人学
摘要
尽管强化学习(RL)具有通用性与可扩展性,保证RL策略的安全行为对安全关键应用仍是重大挑战。为此,我们提出一种将控制理论的验证方法应用于所学值函数的新途径。通过分析安全保持的任务结构,我们形式化建立了值函数与控制障碍函数联系的原创定理。进一步,我们提出用于安全控制任务中值函数验证的新度量,以及改进学习的实际实现细节。我们的工作提出了一种证书学习的新方法,其解锁了控制理论中多种可用于RL策略的验证技术,并朝着基于RL的控制系统之通用、可扩展且可验证设计的正式框架迈出重要一步。代码与视频见此https链接:https://rl-cbf.github.io/
引用
@article{arxiv.2306.04026,
title = {Value Functions are Control Barrier Functions: Verification of Safe Policies using Control Theory},
author = {Daniel C. H. Tan and Fernando Acero and Robert McCarthy and Dimitrios Kanoulas and Zhibin Li},
journal= {arXiv preprint arXiv:2306.04026},
year = {2023}
}