中文

MiniDrive:面向自动驾驶的高效视觉语言模型多层级2D特征作为文本标记

计算机视觉与模式识别 2025-05-22 v5

摘要

视觉语言模型(VLM)作为自动驾驶中的通用端到端模型,通过问答交互执行预测、规划和感知等子任务。然而,大多数现有方法依赖计算昂贵的视觉编码器和大型语言模型(LLM),难以在实际场景和实时应用中部署。同时,大多数现有VLM缺乏处理多图像的能力,难以适应自动驾驶中的多摄像头感知。为此,我们提出一种新框架MiniDrive,集成了我们提出的特征工程混合专家(FE-MoE)模块和动态指令适配器(DI-Adapter)。FE-MoE有效地将2D特征映射为视觉标记嵌入向量,输入到语言模型中。DI-Adapter使视觉标记嵌入能够随指令文本嵌入动态变化,解决了以往方法中相同图像视觉标记嵌入静态的问题。与先前工作相比,MiniDrive在参数规模、浮点运算量和响应效率方面实现了最先进性能,最小版本仅包含830万参数。

关键词

引用

@article{arxiv.2409.07267,
  title  = {MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving},
  author = {Enming Zhang and Xingyuan Dai and Min Huang and Yisheng Lv and Qinghai Miao},
  journal= {arXiv preprint arXiv:2409.07267},
  year   = {2025}
}