中文

面向实时自动驾驶的视觉-语言跨注意力机制

计算机视觉与模式识别 2025-10-14 v3 人工智能 机器学习 机器人学

摘要

自动驾驶汽车需要几何精度和语义理解才能在复杂环境中导航,但大多数系统是分别处理这两者的。我们提出了 XYZ-Drive,一个单一的视觉-语言模型,读取前置摄像头帧、25m ×\times 25m 的俯瞰地图和下一段路径,然后输出方向盘输入和车速。轻量级的以目标为中心的跨注意力层让 waypoint 标记突出显示相关的图像和地图块,支持动作和文本解释,再将融合后的标记输入到部分微调的LLaMA-3.2 11B模型中。在 MD-NEX Outdoor-Driving benchmark 上,XYZ-Drive 实现了 95% 的成功率和 0.80 的成功率加权路径长度 (SPL),超越 PhysNav-DG 15%,碰撞数减半,同时显著提升效率仅使用单分支。十六项消融实验解释了这些提升:移除任何单一模态(视觉、路径、地图)均会使成功率下降最高 11%,证明其互补性和丰富的联系。用简单拼接代替以目标为中心注意力会使性能下降 3%,表明基于查询的融合更有效地注入地图知识。保持变换器冻结会损失 5%,显示在针对自动驾驶等特定任务应用视觉-语言模型时进行微调的重要性。将地图分辨率从 10 cm 粗化到 40 cm 会模糊车道边缘并提高碰撞率。总体而言,这些结果表明,早期在意图和地图布局的 token 级融合能够实现准确、透明且实时的驾驶。

关键词

引用

@article{arxiv.2507.23064,
  title  = {Vision-Language Cross-Attention for Real-Time Autonomous Driving},
  author = {Santosh Patapati and Trisanth Srinivasan and Murari Ambati},
  journal= {arXiv preprint arXiv:2507.23064},
  year   = {2025}
}

备注

5 pages