用视觉问答解释自动驾驶动作
计算机视觉与模式识别
2023-07-21 v1 人工智能
摘要
由于深度学习和计算机视觉算法的快速进展,自动驾驶车辆的端到端学习能力在过去十年取得了显著里程碑。然而,由于自动驾驶技术是人工智能(AI)的安全关键应用,道路事故与既定监管原则使得对自动驾驶车辆智能动作选择的可解释性成为必要。为促进自动驾驶决策的可解释性,我们提出一个视觉问答(VQA)框架,该框架通过基于问答的因果推理来解释驾驶动作。为此,我们首先在仿真环境中使用强化学习(RL)收集驾驶视频,并从该日志数据中为五个选定动作类别均匀提取连续帧。进一步,我们使用问答对作为各场景中所选动作的理由,手动标注提取的帧。最后,我们在未见驾驶场景上评估 VQA 预测动作答案的正确性。实证结果表明,VQA 机制可支持解释自动驾驶车辆的实时决策,并有助于提升整体驾驶安全。
引用
@article{arxiv.2307.10408,
title = {Explaining Autonomous Driving Actions with Visual Question Answering},
author = {Shahin Atakishiyev and Mohammad Salameh and Housam Babiker and Randy Goebel},
journal= {arXiv preprint arXiv:2307.10408},
year = {2023}
}
备注
Accepted to the 2023 IEEE International Conference on Intelligent Transportation Systems (IEEE ITSC-2023)