中文

探索多模态 LLM 作为驾驶世界模型的潜力

机器人学 2024-10-29 v2 计算机视觉与模式识别

摘要

我们对多模态大型语言模型(MLLM)在自动驾驶中的应用进行审慎的检视,挑战有关其解释动态驾驶情景能力的常见假设。尽管 GPT-4o 等模型在复杂驾驶环境中的表现尚未得到充分探索。我们的实验研究评估了 various MLLMs 作为世界模型的应用,结合车内摄像头视角,结果显示虽然这些模型在解释单个图像方面表现出色,但在跨帧构建连贯叙事时难以克服,导致对 (i) 自车动力学、(ii) 与其他道路参与者的互动、(iii) 轨迹规划、(iv) 开放场景推理等的理解出现显著误差。我们引入 Eval-LLM-Drive 数据集和 DriveSim 模拟器以增强评估,凸显当前 MLLM 能力的不足以及在动态真实环境中需要改进模型的迫切性。

关键词

引用

@article{arxiv.2405.05956,
  title  = {Probing Multimodal LLMs as World Models for Driving},
  author = {Shiva Sreeram and Tsun-Hsuan Wang and Alaa Maalouf and Guy Rosman and Sertac Karaman and Daniela Rus},
  journal= {arXiv preprint arXiv:2405.05956},
  year   = {2024}
}

备注

https://github.com/sreeramsa/DriveSim https://www.youtube.com/watch?v=Fs8jgngOJzU