中文

安全关键场景下强化学习的谨慎自适应

机器学习 2021-01-19 v1 机器学习

摘要

在诸如城市驾驶等真实世界安全关键目标场景中,强化学习(RL)是危险的,会危及RL智能体、其他智能体以及环境。为克服此困难,我们提出了一种“安全关键自适应”任务设定:智能体先在诸如模拟器等非安全关键的“源”环境中训练,再自适应到失败代价高昂的目标环境。我们提出了一种名为CARL的解决途径,其基于如下直觉:在多样环境中的先验经验使智能体能估计风险,而这又通过风险厌恶的谨慎自适应实现了相对安全。CARL首先采用基于模型的RL训练概率模型,以捕捉跨多样源环境中转移动态与灾难性状态的不确定性。随后,当在动态未知的新安全关键环境中探索时,CARL智能体规划以避免可能导致灾难性状态的动作。在汽车驾驶、cartpole平衡、half-cheetah运动与机器人物体操控的实验中,CARL成功习得谨慎探索行为,以更少的失败获得比强RL自适应基线更高的奖励。网站见 https://sites.google.com/berkeley.edu/carl。

关键词

引用

@article{arxiv.2008.06622,
  title  = {Cautious Adaptation For Reinforcement Learning in Safety-Critical Settings},
  author = {Jesse Zhang and Brian Cheung and Chelsea Finn and Sergey Levine and Dinesh Jayaraman},
  journal= {arXiv preprint arXiv:2008.06622},
  year   = {2021}
}

备注

15 pages, 8 figures, ICML 2020. Website with code: https://sites.google.com/berkeley.edu/carl