中文

自主系统的黑盒安全验证:一种多保真强化学习方法

系统与控制 2023-03-03 v3 系统与控制

摘要

自主及半自主智能体在社会中日益广泛的应用使得验证其安全性至关重要。然而,其使用的复杂场景可能使形式化验证难以实现。为应对这一挑战,采用基于仿真的安全验证来测试复杂系统。近期使用强化学习的方法易于过度利用已知故障且故障空间覆盖不足。为克服该局限,一种称为“知识MDP”的马尔可夫决策过程被定义。该方法在通过“知道它所知道的”框架估计系统知识时,同时考虑学习到的模型及其元数据(如样本计数)。为解决安全验证问题,开发了一种将双向学习扩展到多保真仿真器的新型算法。该方法的有效性通过一个案例研究得到证明:在其中训练一个对抗者以在网格世界环境中拦截测试模型。蒙特卡洛试验将所提算法的样本效率与单保真仿真器学习进行比较,并显示了将学习模型知识纳入决策过程的重要性。

关键词

引用

@article{arxiv.2203.03451,
  title  = {Black-Box Safety Validation of Autonomous Systems: A Multi-Fidelity Reinforcement Learning Approach},
  author = {Jared J. Beard and Ali Baheri},
  journal= {arXiv preprint arXiv:2203.03451},
  year   = {2023}
}

备注

8 pages, 6 figures, 2 Algorithms, submitted to the 2023 7th IEEE Conference on Control Technology and Applications, Bridgetown, Barbados