面向深度强化学习的弱人类偏好监督
人工智能
2020-12-29 v2
摘要
当前从人类偏好中学习奖励的方法,可通过在轨迹段对之间定义单一固定偏好,解决无法访问奖励函数的复杂强化学习(RL)任务。然而,轨迹间偏好的判断并非动态的,且仍需在数千次迭代中获取人类输入。在本研究中,我们提出了一个弱人类偏好监督框架,为此开发了一个人类偏好缩放模型,该模型自然地反映了人类对轨迹间弱选择程度的感知,并通过监督学习建立了一个人类示范估计器,以生成预测偏好,从而减少人类输入次数。所提出的弱人类偏好监督框架能有效解决复杂 RL 任务,并在模拟机器人运动——MuJoCo 游戏中——相对于单一固定人类偏好,获得更高的累积奖励。此外,我们建立的人类示范估计器仅在智能体与环境交互次数的不到 0.01% 时需要人类反馈,与现有方法相比,显著降低了高达 30% 的人类输入成本。为展示我们方法的灵活性,我们发布了一个视频(https://youtu.be/jQPe1OILT0M),展示了基于不同类型人类输入训练的智能体行为的比较。我们相信,我们这种自然启发且结合弱监督学习的人类偏好方法,有益于精确的奖励学习,并可应用于最先进的 RL 系统,例如人-自主系统协同系统。
引用
@article{arxiv.2007.12904,
title = {Weak Human Preference Supervision For Deep Reinforcement Learning},
author = {Zehong Cao and KaiChiu Wong and Chin-Teng Lin},
journal= {arXiv preprint arXiv:2007.12904},
year = {2020}
}
备注
Submitting to IEEE Transactions on Neural Networks and Learning Systems