面向非平稳环境的上下文感知安全强化学习
机器学习
2021-01-05 v1
摘要
在部署强化学习智能体执行现实任务时,安全性是一个关键问题。近来,安全强化学习算法已被开发出来,以在优化智能体性能的同时避免违反安全约束。然而,很少有研究涉及环境中的非平稳扰动,其可能导致灾难性后果。本文提出上下文感知安全强化学习(CASRL)方法,一种用于在非平稳环境中实现安全适应的元学习框架。我们使用概率潜变量模型,在给定上下文数据的情况下对后验环境转移分布进行快速推断。随后通过不确定性感知的轨迹采样评估安全约束。安全违规的高代价导致数据集中不安全记录稀少。我们通过模型训练期间启用优先采样,以及在约束规划期间利用领域知识构建先验安全约束来解决此问题。该算法在具有非平稳扰动的现实安全关键环境中进行了评估。结果表明,所提算法在安全性与鲁棒性方面显著优于现有基线。
引用
@article{arxiv.2101.00531,
title = {Context-Aware Safe Reinforcement Learning for Non-Stationary Environments},
author = {Baiming Chen and Zuxin Liu and Jiacheng Zhu and Mengdi Xu and Wenhao Ding and Ding Zhao},
journal= {arXiv preprint arXiv:2101.00531},
year = {2021}
}