中文

DeeAD:面向高效自动驾驶的动态早期退出视觉语言动作

计算机视觉与模式识别 2025-11-27 v1 人工智能 机器学习 机器人学

摘要

视觉语言动作(VLA)模型统一了感知、推理和轨迹生成,用于自动驾驶,但因深层变压器堆叠而产生显著推理延迟。我们提出 DeeAD,一种训练免费的、以动作为导向的早期退出框架,通过评估中间轨迹的物理可行性加速 VLA 规划。DeeAD 不依赖置信度得分,在预测轨迹与轻量级规划先验(如导航或低精度规划)在可接受偏差(<2m)范围内一致时终止推理。为提高效率,我们引入多跳控制器,基于得分变化率自适应跳过冗余层。DeeAD 可无需重新训练地集成到现有 VLA 模型(如 ORION)中。Bench2Drive 基准实验表明,DeeAD 实现了最高 28% 的变压器层稀疏化和 29% 的延迟降低,同时保持规划质量和安全性。

关键词

引用

@article{arxiv.2511.20720,
  title  = {DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving},
  author = {Haibo HU and Lianming Huang and Nan Guan and Chun Jason Xue},
  journal= {arXiv preprint arXiv:2511.20720},
  year   = {2025}
}