中文

基于对比风险预测的安全强化学习

人工智能 2022-09-21 v1 机器学习 机器人学

摘要

由于安全违规会在真实世界机器人应用中导致严重后果,强化学习(RL)在机器人领域的日益部署推动了安全探索强化学习(安全 RL)的研究。本工作中,我们提出一种用于安全 RL 的风险预防训练方法,其学习一个统计对比分类器来预测状态-动作对导致不安全状态的概率。基于预测的风险概率,我们可以收集风险预防轨迹,并用风险惩罚重塑奖励函数以诱导安全 RL 策略。我们在机器人仿真环境中开展实验。结果表明所提方法具有与最先进的基于模型方法相当的性能,并优于传统的无模型安全 RL 方法。

关键词

引用

@article{arxiv.2209.09648,
  title  = {Safe Reinforcement Learning with Contrastive Risk Prediction},
  author = {Hanping Zhang and Yuhong Guo},
  journal= {arXiv preprint arXiv:2209.09648},
  year   = {2022}
}