RL-STPA: 为安全关键型强化学习适应系统理论危险分析
机器学习
2026-04-17 v1
摘要
随着强化学习 (RL) 在安全关键领域的部署范围不断扩大,现有的评估方法难以系统性地识别源于神经网络策略黑箱特性以及训练与部署之间分布迁移引起的危险。本文引入强化学习系统理论过程分析 (RL-STPA),一种框架通过三个关键贡献适应传统 STPA 以解决 RL 独特挑战:使用时序阶段分析和领域专家进行层次子任务分解以捕捉涌现行为,采用覆盖导向的扰动测试探索状态-动作空间的敏感性,并通过奖励塑形和课程设计将识别出的危险反馈到训练中的迭代检查点。我们以自主无人机导航着陆作为安全关键测试案例展示 RL-STPA,揭示了标准 RL 评估可能遗漏的潜在损失场景。该框架为从业者提供了系统危险分析工具包、定量安全覆盖度评估指标以及建立操作安全边界的可操作指南。虽然 RL-STPA 无法为任意神经策略提供形式化保证,但它提供了一种在安全关键应用中系统评估和改进 RL 安全性和鲁棒性的实用方法,而这些应用中仍不可行的穷尽式验证方法。
引用
@article{arxiv.2604.15201,
title = {RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning},
author = {Steven A. Senczyszyn and Timothy C. Havens and Nathaniel Rice and Jason E. Summers and Benjamin D. Werner and Benjamin J. Schumeg},
journal= {arXiv preprint arXiv:2604.15201},
year = {2026}
}