安全关键强化学习中从少量环境泛化
机器学习
2019-07-03 v1 人工智能
机器学习
摘要
在将自主智能体部署到真实世界之前,我们需要确信它们能在新颖情境中安全执行。理想情况下,我们会在训练期间让智能体暴露于极广泛的情形,使其了解每种可能的危险,但这往往不切实际。本文研究深度强化学习(RL)中基于有限数量训练环境的安全性与泛化问题。我们发现 RL 算法在未见测试环境上可能危险地失效,即便在训练环境上表现完美。首先,在网格世界设定中,我们表明通过简单修正(包括集成模型平均与使用阻断分类器)可显著减少灾难。在更具挑战性的 CoinRun 环境中,我们发现类似方法并未显著减少灾难。然而,我们确实发现来自集成的不确定性信息可用于预测是否在几步内发生灾难,从而判断是否应请求人工干预。
引用
@article{arxiv.1907.01475,
title = {Generalizing from a few environments in safety-critical reinforcement learning},
author = {Zachary Kenton and Angelos Filos and Owain Evans and Yarin Gal},
journal= {arXiv preprint arXiv:1907.01475},
year = {2019}
}