无错试错:通过人工干预迈向安全强化学习
人工智能
2017-07-18 v1 机器学习
神经与进化计算
摘要
AI 系统正越来越多地应用于涉及与人类交互的复杂任务。在训练期间,此类系统可能具有危险性,因为它们尚未学会避免可能导致严重伤害的行为。AI 系统如何能在不犯任何伤害人类或造成严重损害的错误的情况下进行探索和学习?对于无模型强化学习,让人类“在环”并随时准备干预是目前防止所有灾难的唯一方法。我们将 RL 中的人工干预形式化,并展示如何通过训练监督学习器来模仿人类的干预决策,从而减少所需的人力劳动。我们在 Atari 游戏上评估了该方案,由人类监督深度 RL 智能体四小时。当灾难类别简单时,我们能够在不影响智能体学习的情况下防止所有灾难(而 RL 基线由于灾难性遗忘而失败)。然而,当灾难更复杂时,该方案的成功率较低:它减少了但未能消除灾难,且监督学习器在智能体发现的对抗样本上失败。外推到更具挑战性的环境,我们表明我们的实现无法扩展(由于所需的人力劳动量不可行)。我们概述了若要训练无单一灾难的无模型智能体所必需的方案扩展。
引用
@article{arxiv.1707.05173,
title = {Trial without Error: Towards Safe Reinforcement Learning via Human Intervention},
author = {William Saunders and Girish Sastry and Andreas Stuhlmueller and Owain Evans},
journal= {arXiv preprint arXiv:1707.05173},
year = {2017}
}