面向联合机会约束满足的安全强化学习之探索过程自动调整
机器学习
2021-03-08 v1 人工智能
系统与控制
系统与控制
机器学习
摘要
在强化学习(RL)算法中,学习期间使用探索性控制输入以获取决策与控制所需的知识,而受控对象的真实动力学未知。然而,这种探索特性有时会因违反关于受控对象状态的约束而导致不期望的情形。本文中,我们提出一种利用受控对象线性标称模型、用于连续状态与动作空间下安全 RL 的探索过程自动调整方法。具体而言,我们所提方法依据当前状态及其预测值自动选择各时刻是否使用探索输入,并调整高斯策略中用于探索的方差-协方差矩阵。我们还证明,我们的探索过程调整方法在理论上保证以预设概率满足约束,即每一时刻联合机会约束的满足。最后,通过数值仿真说明了方法的有效性与实用性。
引用
@article{arxiv.2103.03656,
title = {Automatic Exploration Process Adjustment for Safe Reinforcement Learning with Joint Chance Constraint Satisfaction},
author = {Yoshihiro Okawa and Tomotake Sasaki and Hidenao Iwane},
journal= {arXiv preprint arXiv:2103.03656},
year = {2021}
}
备注
Accepted to the 21st IFAC World Congress (IFAC-V 2020)