中文

利用基于模型的架构与人类干预提升强化学习中的安全性

人工智能 2019-03-25 v1

摘要

AI 与强化学习近来的进展在解决具有高维状态空间的复杂问题方面显示出巨大成功。然而,这些成功大多出现在模拟环境中,其中失败几乎或完全无后果。但大多数现实世界应用需要安全的训练方案,因为灾难性失败是不可允许的,尤其在涉及人类交互时。当前,安全强化学习(Safe RL)系统在训练与探索期间使用人类监督,以确保 RL 智能体不进入灾难性状态。这些方法需要大量人力且很难扩展。我们提出一种混合方法,通过结合基于模型的方法并训练一个监督学习器来减少人类干预时间,在提高样本效率的同时确保安全。我们在多种网格世界环境中使用标准与视觉表征评估这些方法,结果表明相较传统的无模型方法,我们的方法在样本效率、到达的灾难性状态数量以及整体任务性能方面均更优。

关键词

引用

@article{arxiv.1903.09328,
  title  = {Improving Safety in Reinforcement Learning Using Model-Based Architectures and Human Intervention},
  author = {Bharat Prakash and Mohit Khatwani and Nicholas Waytowich and Tinoosh Mohsenin},
  journal= {arXiv preprint arXiv:1903.09328},
  year   = {2019}
}