利用人类反馈在3D环境中实现安全深度强化学习
机器学习
2022-01-24 v2
摘要
智能体在训练和部署过程中都应避免不安全行为。这通常需要模拟器和关于不安全行为的程序化规范。遗憾的是,模拟器并非总可获得,且对许多现实任务而言,程序化指定约束可能困难甚至不可能。近期引入的技术ReQueST旨在解决该问题:从安全的人类轨迹学习环境的神经模拟器,再利用所学模拟器从人类反馈高效学习奖励模型。然而,该方法在复杂3D环境中结合真实人类反馈是否可行——能否达到足够的基于像素的神经模拟器质量,以及人类数据需求在数量和质量上是否可行——尚属未知。本文肯定地回答了该问题,使用ReQueST训练智能体执行3D第一人称物体收集任务,数据完全来自人类承包商。我们表明,所得智能体相比标准强化学习,不安全行为减少了一个数量级。
引用
@article{arxiv.2201.08102,
title = {Safe Deep RL in 3D Environments using Human Feedback},
author = {Matthew Rahtz and Vikrant Varma and Ramana Kumar and Zachary Kenton and Shane Legg and Jan Leike},
journal= {arXiv preprint arXiv:2201.08102},
year = {2022}
}