中文

基于目标的视觉-语言驾驶

计算机视觉与模式识别 2025-10-14 v2 人工智能 机器学习 多媒体 机器人学

摘要

自动驾驶车辆必须在毫秒内做出反应,同时对道路几何和交通意图进行推理,以应对复杂情况。我们引入了 NovaDrive,一种单分支视觉-语言架构,它在单一分支中处理前视摄像头图像、HD-map 切片、LiDAR 深度和文本路径点。一个轻量级的两阶段交叉注意力块首先将路径点 token 与 HD map 对齐,然后在细粒度图像和深度块上细化注意力。结合一种阻止突然转向和速度变化的新型平滑损失,该设计消除了对循环记忆的需求。我们对 11B LLaMA-3.2 视觉-语言骨干网络的前 15 层进行微调,从而实现实时推理。在 MD-NEX Outdoor 基准的 nuScenes / Waymo 子集上,NovaDrive 将成功率提高到 84%(+4%),将路径效率(SPL)提升至 0.66(+0.11),并将碰撞频率从 2.6% 降低至 1.2%(-1.4%),相较于先前的 SOTA。我们的消融实验证实,路径点 token、部分 VLM 微调和交叉注意力融合对这些提升的贡献最大。除了安全性之外,NovaDrive 更短的路线(源于新型平滑损失)意味着更低的燃料或电池消耗,指向更精简、更容易更新的驾驶技术栈。NovaDrive 也可以扩展到其他具身 AI 领域。

关键词

引用

@article{arxiv.2507.23042,
  title  = {Goal-Based Vision-Language Driving},
  author = {Santosh Patapati and Trisanth Srinivasan},
  journal= {arXiv preprint arXiv:2507.23042},
  year   = {2025}
}

备注

6 pages