学习具有到达-避免保证的随机系统控制策略
机器学习
2022-11-30 v2 人工智能
系统与控制
系统与控制
摘要
我们研究为具有形式化到达-避免保证的离散时间非线性随机动力系统学习控制器的问题。本工作提出了第一种在无限时间范围内以可容忍概率阈值 提供形式化到达-避免保证的方法,该方法结合并推广了稳定性和安全性保证。我们的方法利用了机器学习文献中的进展,并将形式化证书表示为神经网络。具体而言,我们以到达-避免超鞅(RASM)的形式学习一个证书,这是我们在本工作中引入的一个新概念。我们的 RASMs通过对确定性系统的 Lyapunov 函数水平集的随机扩展施加约束,提供可达性和避免保证。我们的方法解决了几个重要问题——它可用于从头学习控制策略,验证固定控制策略的到达-避免规范,或者在预训练策略不满足到达-避免规范时对其进行微调。我们在 个随机非线性强化学习任务上验证了我们的方法。
引用
@article{arxiv.2210.05308,
title = {Learning Control Policies for Stochastic Systems with Reach-avoid Guarantees},
author = {Đorđe Žikelić and Mathias Lechner and Thomas A. Henzinger and Krishnendu Chatterjee},
journal= {arXiv preprint arXiv:2210.05308},
year = {2022}
}
备注
Accepted at AAAI 2023