DME-Driver:融合人类决策逻辑与三维场景感知的自动驾驶系统
机器人学
2024-01-09 v1 计算机视觉与模式识别
摘要
在自动驾驶领域,自动驾驶汽车系统的两个重要特征是其决策逻辑的可解释性和环境感知的准确性。本文介绍了 DME-Driver,这是一种新型自动驾驶系统,旨在提升自动驾驶系统的性能和可靠性。DME-Driver 利用强大的视觉语言模型作为决策器,并以面向规划的三维感知模型作为控制信号生成器。为确保驾驶决策的可解释性和可靠性,逻辑决策器基于大型视觉语言模型构建。该模型遵循经验丰富的人类驾驶员所采用的逻辑,并以类似的方式做出决策。另一方面,精确控制信号的生成依赖于精确且详细的环境感知,而这正是三维场景感知模型所擅长的领域。因此,采用了一个面向规划的三维感知模型作为信号生成器。它将决策器做出的逻辑决策转化为自动驾驶汽车的精确控制信号。为了有效训练所提出的模型,我们创建了一个新的自动驾驶数据集。该数据集涵盖了多样化的人类驾驶员行为及其背后的动机。通过利用该数据集,我们的模型通过逻辑思维过程实现了高精度的规划准确性。
引用
@article{arxiv.2401.03641,
title = {DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving},
author = {Wencheng Han and Dongqian Guo and Cheng-Zhong Xu and Jianbing Shen},
journal= {arXiv preprint arXiv:2401.03641},
year = {2024}
}