中文

用于探索的保守安全评论家

机器学习 2021-04-27 v2 人工智能 机器人学 机器学习

摘要

安全探索在强化学习(RL)中是一个重大挑战:当主动数据收集需要部署部分训练的策略时,我们必须确保这些策略避免灾难性不安全区域,同时仍能支持试错学习。本文中,我们通过评论家学习环境状态的保守安全估计,以靶向解决 RL 中的安全探索问题,并在每次训练迭代中可证明地上界灾难性失败的可能性。我们从理论上刻画了安全性与策略改进之间的权衡,表明安全约束在训练期间以高概率很可能被满足,推导出我们方法的可证明收敛保证(其渐近上不差于标准 RL),并在一组具有挑战性的导航、操控与运动任务上展示所提方法的有效性。实证上,我们表明所提方法能在取得有竞争力的任务性能的同时,在训练期间比先前方法产生显著更低的灾难性失败率。视频见此网址 https://sites.google.com/view/conservative-safety-critics/home

关键词

引用

@article{arxiv.2010.14497,
  title  = {Conservative Safety Critics for Exploration},
  author = {Homanga Bharadhwaj and Aviral Kumar and Nicholas Rhinehart and Sergey Levine and Florian Shkurti and Animesh Garg},
  journal= {arXiv preprint arXiv:2010.14497},
  year   = {2021}
}

备注

Published as a conference paper in ICLR 2021