中文

存在扰动时强化学习的安全探索方法

机器学习 2023-03-21 v2 人工智能 系统与控制 系统与控制 机器学习

摘要

近年来强化学习算法的快速发展为诸多领域带来了新的可能。然而,由于其探索特性,当我们将这些算法应用于安全关键问题尤其是真实环境时,必须考量风险。本研究处理存在扰动时强化学习中的安全探索问题。我们将学习过程中的安全性定义为显式以状态定义的约束条件的满足,并提出一种利用受控对象与扰动的局部先验知识的安全探索方法。所提方法保证即便受控对象暴露于服从正态分布的随机扰动下,也能以预先指定概率满足显式状态约束。作为理论结果,我们给出了构造不含探索成分的保守输入(用于所提方法)的充分条件,并证明在上述意义下所提方法的安全性得以保证。此外,我们通过倒立摆与四杆并联连杆机械臂的数值仿真说明了所提方法的有效性与实用性。

关键词

引用

@article{arxiv.2209.15452,
  title  = {Safe Exploration Method for Reinforcement Learning under Existence of Disturbance},
  author = {Yoshihiro Okawa and Tomotake Sasaki and Hitoshi Yanami and Toru Namerikawa},
  journal= {arXiv preprint arXiv:2209.15452},
  year   = {2023}
}

备注

Accepted by the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECMLPKDD) 2022. The Version of Record is available at https://doi.org/10.1007/978-3-031-26412-2_9