中文

一种用于安全高效强化学习的乘性价值函数

机器人学 2023-03-08 v1 机器学习

摘要

序列决策问题中一个新兴领域是安全强化学习(RL),其目标是在遵守安全约束的同时最大化奖励。能够处理约束对于在现实环境中部署 RL 智能体至关重要,因为约束违反会损害智能体与环境。为此,我们提出一种安全的无模型 RL 算法,其具有由安全评论员与奖励评论员组成的新型乘性价值函数。安全评论员预测约束违反的概率,并对仅估计无约束回报的奖励评论员进行折扣。通过拆分职责,我们简化了学习任务,从而提升了样本效率。我们将该方法集成到两种流行 RL 算法——Proximal Policy Optimization 与 Soft Actor-Critic 中,并在四个以安全为重点的环境中评估我们的方法,包括增强了安全约束的经典 RL 基准以及以图像和原始 Lidar 扫描作为观测的机器人导航任务。最后,我们实现了零样本 sim-to-real 迁移,其中差速驱动机器人须穿越杂乱房间。我们的代码见 https://github.com/nikeke19/Safe-Mult-RL。

关键词

引用

@article{arxiv.2303.04118,
  title  = {A Multiplicative Value Function for Safe and Efficient Reinforcement Learning},
  author = {Nick Bührer and Zhejun Zhang and Alexander Liniger and Fisher Yu and Luc Van Gool},
  journal= {arXiv preprint arXiv:2303.04118},
  year   = {2023}
}

备注

Repository available at https://github.com/nikeke19/Safe-Mult-RL