中文

OneDrive:基于视觉语言动作模型的统一多范式驾驶

计算机视觉与模式识别 2026-04-21 v1

摘要

视觉语言模型(VLM)在自回归文本生成方面表现优异,但端到端自动驾驶需要进行多任务学习,包含结构化输出和异构解码行为,如自回归语言生成、平行目标检测和轨迹回归。为适应这些差异,现有系统通常引入独立或级联解码器,导致架构碎片化和有效背部资源受限。在本工作中,我们构建了一个基于预训练 VLM 的统一自动驾驶框架,其中将异构解码行为在单一转换器解码器内统一。我们展示,预训练 VLM 注意力在纯语言建模之外具有强大的可迁移性。通过将视觉和结构查询标记组织到单个因果解码器中,结构查询可自然地通过原始注意力机制在视觉上下文上进行条件化。文本和结构输出共享常见的注意力背部,实现跨异构任务的稳定联合优化。轨迹规划通过引入结构轨迹查询实现,置于相同的因果 LLM 解码器中。这一统一表述使规划能够与图像和感知标记共享预训练注意力背板。在端到端自动驾驶基准测试中进行了广泛实验,展示了包括 0.28 L2 距离和 0.18 碰撞率在内的领先性能,以及在 NAVSIM 闭环评估中(86.8 PDMS)的具竞争力的结果。该完整模型保留多模态生成能力,而高效推理模式实现约 40% 的延迟降低。代码和模型可在 https://github.com/Z1zyw/OneDrive 获取。

关键词

引用

@article{arxiv.2604.17915,
  title  = {OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models},
  author = {Yiwei Zhang and Xuesong Chen and Jin Gao and Hanshi Wang and Fudong Ge and Weiming Hu and Shaoshuai Shi and Zhipeng Zhang},
  journal= {arXiv preprint arXiv:2604.17915},
  year   = {2026}
}