中文

通过鸟瞰图注入的多模态大模型实现整体自动驾驶理解

计算机视觉与模式识别 2024-01-03 v1

摘要

多模态大语言模型的兴起激发了基于语言的驾驶任务研究。然而,现有研究通常关注有限的任务,并且常常忽略对鲁棒自动驾驶至关重要的多视图和时间信息。为了弥补这些差距,我们引入了NuInstruct,一个包含91K多视图视频-问答对的新数据集,涵盖17个子任务,每个任务都需要整体信息(例如时间、多视图和空间),显著提升了挑战级别。为了获得NuInstruct,我们提出了一种新颖的基于SQL的方法来自动生成指令-响应对,该方法受人类驾驶逻辑过程的启发。我们进一步提出了BEV-InMLLM,一种端到端方法,用于高效提取与指令相关的鸟瞰图特征,并与大语言模型进行语言对齐。BEV-InMLLM集成了多视图、空间感知和时间语义,以增强MLLM在NuInstruct任务上的能力。此外,我们提出的BEV注入模块是一种即插即用的方法,适用于现有MLLM。我们在NuInstruct上的实验表明,BEV-InMLLM显著优于现有MLLM,例如在各种任务上提高了约9%。我们计划发布NuInstruct以促进未来的研究发展。

关键词

引用

@article{arxiv.2401.00988,
  title  = {Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models},
  author = {Xinpeng Ding and Jinahua Han and Hang Xu and Xiaodan Liang and Wei Zhang and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2401.00988},
  year   = {2024}
}