中文

基于顶点网络的控制仿射系统安全强化学习

机器学习 2020-03-24 v1 系统与控制 系统与控制 机器学习

摘要

本文关注于为具有硬状态与动作约束的控制系统寻找强化学习策略。尽管强化学习在许多领域取得成功,但其难以应用于具有硬约束的问题,尤其是当状态变量与动作均受约束时。先前旨在确保约束满足(即安全性)的工作集中于向学习到的策略添加投影步骤。然而,该方法需在每次策略执行步求解一个优化问题,可能导致显著的计算成本。为应对此问题,本文提出一种称为顶点网络(VNs)的新方法,通过将安全约束融入策略网络架构,在探索过程与学习到的控制策略上均提供安全性保证。利用凸集内所有点均可表示为该凸集顶点的凸组合这一几何性质,所提算法首先学习凸组合权重,随后将这些权重与预计算顶点结合以输出动作。所输出的动作按构造保证安全。数值算例表明,所提 VN 算法在多种基准控制任务中优于朴素强化学习。

关键词

引用

@article{arxiv.2003.09488,
  title  = {Safe Reinforcement Learning of Control-Affine Systems with Vertex Networks},
  author = {Liyuan Zheng and Yuanyuan Shi and Lillian J. Ratliff and Baosen Zhang},
  journal= {arXiv preprint arXiv:2003.09488},
  year   = {2020}
}