中文

面向安全关键任务的带恢复策略的离线目标条件强化学习

机器人学 2024-03-05 v1 人工智能 机器学习

摘要

离线目标条件强化学习(GCRL)旨在从离线数据集中解决具有稀疏奖励的目标达成任务。虽然先前的工作展示了智能体学习接近最优策略的各种方法,但这些方法在处理复杂环境中的多种约束(如安全约束)时存在局限性。其中一些方法优先考虑目标达成而不考虑安全性,而另一些方法则过度关注安全性而牺牲了训练效率。在本文中,我们研究了约束离线GCRL问题,并提出了一种名为基于恢复的监督学习(RbSL)的新方法,以完成具有各种目标的安全关键任务。为了评估方法性能,我们基于具有随机位置障碍物的机器人抓取环境构建了一个基准,并使用专家或随机策略生成离线数据集。我们将RbSL与三种离线GCRL算法和一种离线安全RL算法进行了比较。结果,我们的方法在很大程度上优于现有的最先进方法。此外,我们通过将RbSL部署在真实的Panda机械臂上验证了其实用性和有效性。代码可在https://github.com/Sunlighted/RbSL.git获取。

关键词

引用

@article{arxiv.2403.01734,
  title  = {Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy},
  author = {Chenyang Cao and Zichen Yan and Renhao Lu and Junbo Tan and Xueqian Wang},
  journal= {arXiv preprint arXiv:2403.01734},
  year   = {2024}
}

备注

Accepted by ICRA24