通过可达-规避强化学习提供安全性与活性保证
机器学习
2022-01-25 v1 机器人学
系统与控制
系统与控制
摘要
可达-规避最优控制问题要求系统必须达到某些目标条件同时避开不可接受的失效模式,是自主机器人系统安全性与活性保障的核心,但其精确解对于复杂动力学与环境而言难以求解。近期强化学习方法在近似求解带性能目标的最优控制问题上取得成功,使其应用于认证问题颇具吸引力;然而,强化学习中使用的拉格朗日型目标不适合编码时序逻辑要求。近期工作将强化学习机制拓展至安全型问题展现出前景,其后者的目标不是求和,而是时间上的最小(或最大)值。本工作中,我们将强化学习公式推广以处理可达-规避类别中的所有最优控制问题。我们推导了具有压缩映射性质的时间折扣可达-规避 Bellman 备份,并证明所得可达-规避 Q-learning 算法在传统拉格朗日型问题的类似条件下收敛, yielding 对可达-规避集的任意紧保守近似。我们进一步展示了该公式与深度强化学习方法的结合使用,在模型预测监督控制框架中将近似解视为不可信预言机从而保留零违例保证。我们在一系列非线性系统上评估了所提框架,针对解析与数值解进行验证,并通过此前难以处理问题中的蒙特卡洛仿真验证。我们的结果为一系列面向安全且活性自主行为的学习型方法打开了大门,可应用于机器人与自动化领域。参见 https://github.com/SafeRoboticsLab/safety_rl 获取代码与补充材料。
引用
@article{arxiv.2112.12288,
title = {Safety and Liveness Guarantees through Reach-Avoid Reinforcement Learning},
author = {Kai-Chieh Hsu and Vicenç Rubies-Royo and Claire J. Tomlin and Jaime F. Fisac},
journal= {arXiv preprint arXiv:2112.12288},
year = {2022}
}
备注
Accepted in Robotics: Science and Systems (RSS), 2021