中文

结构化标注促进面向终端无人驾驶的快速视觉语言模型

计算机视觉与模式识别 2026-05-19 v2 人工智能

摘要

视觉语言模型 (VLM) 因其类人推理能力,被视为端到端无人驾驶的有前景的方案。然而,当前 VLM 与实际无人驾驶应用之间仍存在诸多差距。一个主要局限是现有数据集采用松散格式的语言描述,难以被机器理解且可能引入冗余。此外,VLM 的高计算成本和大规模参数规模阻碍了推理速度和实际部署。为弥合差距,本文引入了结构化简洁的基准数据集 NuScenes-S,源自 NuScenes 数据集,包含机器友好的数据结构表示。此外,我们提出 FastDrive,一个参数量为 0.9B 的紧凑型 VLM 基线。与已有参数超过 7B 且处理非结构化语言的模型(如 LLaVA-1.5)不同,FastDrive 能够理解结构化简洁的描述,并以高效生成机器友好的驾驶决策。大量实验表明,FastDrive 在结构化数据集上实现了竞争性能,决策任务准确率提升约 20%,同时在推理速度上超越了大参数基线,实现了 10 倍以上的加速。此外,消融研究进一步关注场景标注(如天气、时间)对决策任务的影响,证明其在无人驾驶决策任务中的重要性。

关键词

引用

@article{arxiv.2506.05442,
  title  = {Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving},
  author = {Hao Jiang and Chuan Hu and Yukang Shi and Yuan He and Ke Wang and Xi Zhang and Zhipeng Zhang},
  journal= {arXiv preprint arXiv:2506.05442},
  year   = {2026}
}