基于对比风险预测的安全强化学习
人工智能
2022-09-21 v1 机器学习
机器人学
摘要
由于安全违规会在真实世界机器人应用中导致严重后果,强化学习(RL)在机器人领域的日益部署推动了安全探索强化学习(安全 RL)的研究。本工作中,我们提出一种用于安全 RL 的风险预防训练方法,其学习一个统计对比分类器来预测状态-动作对导致不安全状态的概率。基于预测的风险概率,我们可以收集风险预防轨迹,并用风险惩罚重塑奖励函数以诱导安全 RL 策略。我们在机器人仿真环境中开展实验。结果表明所提方法具有与最先进的基于模型方法相当的性能,并优于传统的无模型安全 RL 方法。
引用
@article{arxiv.2209.09648,
title = {Safe Reinforcement Learning with Contrastive Risk Prediction},
author = {Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2209.09648},
year = {2022}
}