基于李雅普诺夫的不确定性感知安全强化学习
机器学习
2021-07-30 v1 人工智能
机器学习
摘要
强化学习(RL)在学习各类序贯决策任务的最优策略方面已展现出良好的性能。然而,在许多现实世界的 RL 问题中,除了优化主要目标外,智能体还需满足一定程度的安全性(例如自动驾驶中避免碰撞)。虽然 RL 问题通常被形式化为马尔可夫决策过程(MDP),但安全约束是通过约束马尔可夫决策过程(CMDP)引入的。尽管安全 RL 的最新进展已能在 CMDP 中学习安全策略,但这些安全要求应在训练和部署过程中均得到满足。此外,研究表明,在基于记忆和部分可观测的环境中,这些方法无法在未见过的分布外观测上维持安全性。为应对这些局限,我们提出了一种基于李雅普诺夫的不确定性感知安全 RL 模型。该模型采用李雅普诺夫函数,将基于轨迹的约束转化为一组局部线性约束。进一步,为确保智能体在高不确定性环境中的安全,我们开发了一种不确定性量化方法,通过估计约束违反的概率来识别风险规避动作。此外,集成了 Transformers 模型,借助自注意力机制为智能体提供记忆以处理长时间跨度的信息。所提模型在网格世界导航任务中进行了评估,其中安全性定义为在完全与部分可观测环境中避开静态和动态障碍物。实验结果表明,该智能体在实现最优性和满足安全约束方面的性能均有显著提升。
引用
@article{arxiv.2107.13944,
title = {Lyapunov-based uncertainty-aware safe reinforcement learning},
author = {Ashkan B. Jeddi and Nariman L. Dehghani and Abdollah Shafieezadeh},
journal= {arXiv preprint arXiv:2107.13944},
year = {2021}
}
备注
Submitted to IEEE Transactions on Neural Networks and Learning Systems