SMARLA:一种深度强化学习智能体的安全监控方法
机器学习
2026-02-06 v4 人工智能
软件工程
摘要
深度强化学习(DRL)通过在环境中交互学习最优策略,在自动驾驶、医疗和机器人等多个领域取得了显著进展。然而,DRL 在安全关键领域的应用面临挑战,尤其是所学策略的安全性问题。专注于最大化奖励的 DRL 智能体可能选择不安全动作,导致安全违规。因此,运行时安全监控对于保障这些智能体在安全不可预测和动态环境中的安全运行至关重要。本文提出 SMARLA,一种专为 DRL 智能体设计的黑盒安全监控方法。SMARLA 利用机器学习,通过观测智能体执行期间的行为来预测安全违规。该方法基于 Q 值,其反映了在特定状态下采取动作的预期奖励。SMARLA 采用状态抽象以降低状态空间复杂度,增强监控模型的预测能力。这种抽象能够实现不安全状态的早期检测,从而在事故发生前实施纠正与预防措施。我们在 DRL 研究中广泛使用的三个知名案例研究上对 SMARLA 进行了定量与定性验证。实证结果表明,SMARLA 能准确预测安全违规,误报率低,并能在违规发生前、约智能体执行过程的中途阶段早期预测违规。我们还讨论了基于预测违规概率置信区间的不同决策准则,以触发安全机制,旨在早期检测与低误报率之间取得权衡。
引用
@article{arxiv.2308.02594,
title = {SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents},
author = {Amirhossein Zolfagharian and Manel Abdellatif and Lionel C. Briand and Ramesh S},
journal= {arXiv preprint arXiv:2308.02594},
year = {2026}
}