中文

Dolphins:面向驾驶的多模态语言模型

计算机视觉与模式识别 2023-12-04 v1

摘要

全自动驾驶汽车(AV)能够在复杂现实场景中具备类人理解和响应能力是追求的目标。本文介绍Dolphins,一种新颖的视觉语言模型,旨在作为对话式驾驶助手赋予类人能力。Dolphins擅长处理包含视频(或图像)数据、文本指令和历史控制信号的多模态输入,以生成与所提供指令对应的信息输出。基于开源预训练视觉语言模型OpenFlamingo,我们首先通过创新的基于事实的思维链(GCoT)过程增强Dolphins的推理能力。然后,通过构建驾驶专用指令数据并进行指令微调,将Dolphins定制到驾驶领域。利用BDD-X数据集,我们将四个不同的自动驾驶任务设计并整合到Dolphins中,以促进对复杂驾驶场景的整体理解。因此,Dolphins的独特特征体现在两个维度:(1)能够全面理解复杂且长尾的开放世界驾驶场景,并解决一系列自动驾驶任务;(2)涌现出类人能力,包括通过上下文学习实现的无梯度即时适应以及通过反思实现错误恢复。

关键词

引用

@article{arxiv.2312.00438,
  title  = {Dolphins: Multimodal Language Model for Driving},
  author = {Yingzi Ma and Yulong Cao and Jiachen Sun and Marco Pavone and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2312.00438},
  year   = {2023}
}

备注

The project page is available at https://vlm-driver.github.io/