中文

基于人类偏好的深度强化学习

机器学习 2023-02-20 v4 人工智能 人机交互 机器学习

摘要

为了使复杂的强化学习(RL)系统能够与现实世界环境进行有用的交互,我们需要向这些系统传达复杂的目标。在这项工作中,我们探索了基于(非专家)人类在轨迹段对之间的偏好所定义的目标。我们表明,这种方法可以在没有奖励函数访问权限的情况下有效解决复杂的 RL 任务,包括 Atari 游戏和模拟机器人运动,同时仅对智能体与环境交互的不到百分之一提供反馈。这大大降低了人类监督的成本,使其可以实际应用于最先进的 RL 系统。为了展示我们方法的灵活性,我们表明可以用大约一小时的人类时间成功训练复杂的新行为。这些行为和环境比以前从人类反馈中学到的任何行为和环境都要复杂得多。

关键词

引用

@article{arxiv.1706.03741,
  title  = {Deep reinforcement learning from human preferences},
  author = {Paul Christiano and Jan Leike and Tom B. Brown and Miljan Martic and Shane Legg and Dario Amodei},
  journal= {arXiv preprint arXiv:1706.03741},
  year   = {2023}
}