中文

利用人类反馈在3D环境中实现安全深度强化学习

机器学习 2022-01-24 v2

摘要

智能体在训练和部署过程中都应避免不安全行为。这通常需要模拟器和关于不安全行为的程序化规范。遗憾的是,模拟器并非总可获得,且对许多现实任务而言,程序化指定约束可能困难甚至不可能。近期引入的技术ReQueST旨在解决该问题:从安全的人类轨迹学习环境的神经模拟器,再利用所学模拟器从人类反馈高效学习奖励模型。然而,该方法在复杂3D环境中结合真实人类反馈是否可行——能否达到足够的基于像素的神经模拟器质量,以及人类数据需求在数量和质量上是否可行——尚属未知。本文肯定地回答了该问题,使用ReQueST训练智能体执行3D第一人称物体收集任务,数据完全来自人类承包商。我们表明,所得智能体相比标准强化学习,不安全行为减少了一个数量级。

关键词

引用

@article{arxiv.2201.08102,
  title  = {Safe Deep RL in 3D Environments using Human Feedback},
  author = {Matthew Rahtz and Vikrant Varma and Ramana Kumar and Zachary Kenton and Shane Legg and Jan Leike},
  journal= {arXiv preprint arXiv:2201.08102},
  year   = {2022}
}