ReMAV:用于发现自动驾驶车辆潜在失效事件的奖励建模
人工智能
2024-01-02 v2
摘要
自动驾驶车辆是先进的驾驶系统,众所周知其易受各种对抗攻击,危及车辆安全并对其他道路使用者构成风险。相较于通过与环境交互主动训练复杂对手,亟需首先智能地寻找并缩减搜索空间,仅聚焦于那些自动驾驶车辆置信度较低的态。本文提出一种黑盒测试框架 ReMAV,其利用离线轨迹首先分析自动驾驶车辆的现有行为,并确定合适阈值以发现失效事件的概率。为此,我们引入三步方法:i) 使用任意被测自动驾驶车辆的离线状态-动作对;ii) 利用我们设计的奖励建模技术构建抽象行为表示,以分析存在不确定驾驶决策的态;iii) 对驾驶决策置信度较低处使用扰动模型进行最小扰动攻击。我们的奖励建模技术有助于创建行为表示,即使标准自动驾驶车辆表现良好,也能突出可能不确定行为的区域。我们在高保真城市驾驶环境中使用包含单智能体与多智能体交互的三种不同驾驶场景进行实验。实验显示,被测自动驾驶车辆在车辆碰撞、道路物体碰撞、行人碰撞和偏离道路转向事件的发生上分别增加 35%、23%、48% 和 50%,表明失效事件显著增加。我们将 ReMAV 与两种基线比较,表明在所有评估指标上 ReMAV 生成失效事件的有效性均显著优于基线。
引用
@article{arxiv.2308.14550,
title = {ReMAV: Reward Modeling of Autonomous Vehicles for Finding Likely Failure Events},
author = {Aizaz Sharif and Dusica Marijan},
journal= {arXiv preprint arXiv:2308.14550},
year = {2024}
}