安全深度强化学习的概率保证
人工智能
2020-07-09 v2
摘要
深度强化学习已成功应用于许多控制任务,但由于安全问题,此类智能体在安全关键场景中的应用受到限制。对这些控制器进行严格测试具有挑战性,特别是当它们由于例如硬件故障或噪声传感器而在概率环境中运行时。我们提出 MOSAIC,一种用于在随机设置中测量深度强化学习智能体安全性的算法。我们的方法基于对控制器在环境中执行的正式抽象进行迭代构建,并利用马尔可夫决策过程的概率模型检测,在有限时间范围内对安全行为产生概率保证。它针对不同的初始配置产生控制器安全操作概率的界限,并识别出可以保证正确行为的区域。我们在为若干基准控制问题训练的智能体上实现并评估了我们的方法。
引用
@article{arxiv.2005.07073,
title = {Probabilistic Guarantees for Safe Deep Reinforcement Learning},
author = {Edoardo Bacci and David Parker},
journal= {arXiv preprint arXiv:2005.07073},
year = {2020}
}