自主间隔保障中深度强化学习的安全性增强
人工智能
2022-02-22 v3
摘要
在复杂高密度空域环境中,间隔保障任务对空中交通管制员极具挑战。我们此前的工作利用深度强化学习(DRL)开发了自主间隔保障框架,其中学习到的模型建议速度机动。为提升该模型在含不确定性的未知环境中的安全性,本文提出一种用于自主间隔保障应用中 DRL 的安全模块。所提模块直接处理模型不确定性与状态不确定性以提升安全性。我们的安全模块包含两个子模块:(1)状态安全子模块基于执行时数据增强方法,在模型输入状态中引入状态扰动;(2)模型安全子模块是一种蒙特卡洛 dropout 扩展,学习 DRL 模型策略的后验分布。我们在具有挑战性环境设置的开源空中交通模拟器中展示了两个子模块的有效性。通过大量数值实验,结果表明所提子安全模块显著帮助 DRL 智能体在自主间隔保障任务中提升其安全性能。
引用
@article{arxiv.2105.02331,
title = {Safety Enhancement for Deep Reinforcement Learning in Autonomous Separation Assurance},
author = {Wei Guo and Marc Brittain and Peng Wei},
journal= {arXiv preprint arXiv:2105.02331},
year = {2022}
}