基于课程引导的安全强化学习
机器学习
2021-01-22 v2 人工智能
机器人学
摘要
在安全攸关的应用中,自主智能体可能需要在一个犯错代价极高的环境中进行学习。在此类场景中,智能体不仅需要在学习完成后表现安全,在学习过程中也需如此。为实现这一目标,现有的安全强化学习方法使智能体依赖先验知识,从而在探索时以高概率避免危险情况,但先验知识中固有的概率保证和平滑性假设在自动驾驶等许多受关注的场景中并不可行。本文提出了一种受人类教学启发的替代方法,其中智能体在自动指导器的监督下进行学习,该指导器可防止智能体在学习过程中违反约束。在该模型中,我们引入了一个监视器,它既不需要知道如何出色地完成智能体正在学习的任务,也不需要了解环境的运行机制。相反,它拥有一个重置控制器库,当智能体开始表现出危险行为时,它会激活这些控制器以防止其造成损害。至关重要的是,在何种情况下应用哪个重置控制器的选择会影响智能体的学习速度。基于对智能体进展的观察,教师自身学习一种选择重置控制器的策略,即一种课程,以优化智能体最终策略的奖励。我们的实验在两个环境中使用了该框架,以引导出安全且高效学习的课程。
引用
@article{arxiv.2006.12136,
title = {Safe Reinforcement Learning via Curriculum Induction},
author = {Matteo Turchetta and Andrey Kolobov and Shital Shah and Andreas Krause and Alekh Agarwal},
journal= {arXiv preprint arXiv:2006.12136},
year = {2021}
}