中文

Recovery RL:基于习得恢复区的安全强化学习

机器学习 2021-05-19 v2 人工智能 机器人学

摘要

安全性仍是阻碍 RL 在现实世界中广泛应用的核心障碍:在不确定环境中学习新任务需要大量探索,而安全性要求限制探索。我们提出 Recovery RL,一种通过以下方式应对此权衡的算法:(1) 在策略学习前利用离线数据了解违反约束的区域;(2) 将提升任务性能与满足约束的目标分离到两个策略上:仅优化任务奖励的任务策略,以及在可能违反约束时将智能体引导至安全的恢复策略。我们在 6 个仿真域上评估 Recovery RL,包括两个富含接触的操纵任务、一个基于图像的导航任务,以及物理机器人上基于图像的避障任务。我们将 Recovery RL 与 5 种先前的安全 RL 方法比较,这些方法通过约束优化或奖励塑形联合优化任务性能与安全性,发现 Recovery RL 在所有域上均优于次优的先前方法。结果表明,Recovery RL 在仿真域中权衡约束违反与任务成功的效率高 2 至 20 倍,在物理实验中高 3 倍。参见 https://tinyurl.com/rl-recovery 获取视频与补充材料。

关键词

引用

@article{arxiv.2010.15920,
  title  = {Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones},
  author = {Brijen Thananjeyan and Ashwin Balakrishna and Suraj Nair and Michael Luo and Krishnan Srinivasan and Minho Hwang and Joseph E. Gonzalez and Julian Ibarz and Chelsea Finn and Ken Goldberg},
  journal= {arXiv preprint arXiv:2010.15920},
  year   = {2021}
}

备注

RA-L and ICRA 2021. First two authors contributed equally