开阔海域安全强化学习中可证明的交通规则合规性
机器学习
2024-05-20 v2 系统与控制
系统与控制
摘要
为了安全运行,自动驾驶载具必须遵守以自然语言制定于法律文件中的交通规则。时序逻辑是形式化此类交通规则的合适概念。然而,时序逻辑规则通常会导致难以使用基于优化的运动规划器求解的约束。强化学习(RL)是为自动驾驶载具寻找运动规划的一种有前景的方法。但是,原始的 RL 算法基于随机探索,且不会自动遵守交通规则。我们的方法通过将时序逻辑规范集成到 RL 中,实现了有保证的规则合规性。具体而言,我们考虑了开阔海域船舶的应用,这些船舶必须遵守《国际海上避碰规则公约》(COLREGS)。为了高效合成符合规则的动作,我们将基于集合预测的谓词与表示我们形式化规则及其优先级的状态图相结合。随后,动作掩码将 RL 智能体限制在这组经过验证的合规动作内。在针对关键海上交通情况的数值评估中,我们的智能体在训练和部署期间始终遵守形式化的法律规则,且在实现高目标到达率的同时从未发生碰撞。相比之下,原始的以及引入交通规则信息的 RL 智能体即使在训练后也频繁违反交通规则并发生碰撞。
引用
@article{arxiv.2402.08502,
title = {Provable Traffic Rule Compliance in Safe Reinforcement Learning on the Open Sea},
author = {Hanna Krasowski and Matthias Althoff},
journal= {arXiv preprint arXiv:2402.08502},
year = {2024}
}