VLDrive:用于高效语言引导自动驾驶的视觉增强轻量级MLLM
等离子体物理
2025-12-23 v3
摘要
语言引导自动驾驶的最新进展得益于大型语言模型复杂的认知和推理能力而得到显著推动。然而,当前基于LLM的方法遇到了关键挑战:(1) 失败分析表明,源于视觉表示局限性的频繁碰撞和遮挡,仍然是稳健驾驶性能的主要障碍。(2) LLM的大量参数带来了相当大的部署困难。为了解决这些局限性,我们引入了VLDrive,一种具有增强视觉组件的新型轻量级MLLM架构方法。VLDrive通过创新策略实现了紧凑的视觉token,包括循环一致的动态视觉剪枝和记忆增强的特征聚合。此外,我们提出了一种距离解耦的指令注意力机制,以改善联合视觉-语言特征学习,特别是对于长距离视觉token。在CARLA模拟器中进行的大量实验证明了VLDrive的有效性。值得注意的是,VLDrive在将参数减少81%(从7B减少到1.3B)的同时,实现了最先进的驾驶性能,在闭环评估中,分别在微小、短和长距离下取得了15.4%、16.8%和7.6%的显著驾驶分数提升。代码可在 https://github.com/ReaFly/VLDrive 获取。
引用
@article{arxiv.2511.06255,
title = {Beam-tracing and profile evolution for localised beams in inhomogeneous plasmas},
author = {Lewin B. S. Marsh and Felix I. Parra and Valerian H. Hall-Chen and Juan Ruiz Ruiz},
journal= {arXiv preprint arXiv:2511.06255},
year = {2025}
}
备注
Preprint. Intended for journal submission