中文

AD-EE:面向自动驾驶的快速且可靠的视觉语言模型的早期退出框架

计算机视觉与模式识别 2025-10-13 v2 人工智能

摘要

随着自动驾驶技术的快速发展,将视觉语言模型(Vision-Language Models, VLM)部署以增强感知与决策功能已变得日益常见。然而,高延迟和计算开销限制了VLM在实际应用中的实时性,制约了其在关键时刻驾驶场景中的效能。尤其当VLM在 confident 预测后仍继续处理不必要的层(即过度推理)时,这一挑战尤为突出。为解决此效率问题,本文提出AD-EE框架,集成自动驾驶领域特征,并利用因果推断识别最优退出层。我们在大规模真实世界自动驾驶数据集上进行评估,包括Waymo数据集、以角落案例为导向的CODA数据集,以及运行Autoware Universe平台的真实车辆。广泛实验表明,该方法显著降低延迟,最高提升达57.58%,并提升目标检测精度,最高提升达44%。

关键词

引用

@article{arxiv.2506.05404,
  title  = {AD-EE: Early Exiting for Fast and Reliable Vision-Language Models in Autonomous Driving},
  author = {Lianming Huang and Haibo Hu and Yufei Cui and Jiacheng Zuo and Shangyu Wu and Nan Guan and Chun Jason Xue},
  journal= {arXiv preprint arXiv:2506.05404},
  year   = {2025}
}

备注

We believe that the contribution of this paper is not enough, so we integrated it into another new paper. The arXiv ID of the new paper is arXiv:2510.01795