中文

从表征互补到双系统: synergizing VLM 和视觉-仅主干用于端到端驾驶

机器人学 2026-02-12 v1 计算机视觉与模式识别

摘要

视觉-语言-动作(VLA)驾驶通过语言启用主干增强端到端(E2E)规划,但究竟引入何种变化超出常规的准确性-成本权衡之外尚不明了。我们以RecogDrive为例,通过在相同扩散Transformer规划器下实例化完整VLM和视觉-仅主干,重新提出此问题。RQ1:在主干层面,VLM可在视觉-仅主干之上引入额外子空间。RQ2:这种独特子空间导致某些长尾场景下的行为差异:VLM倾向于更激进,而ViT更保守,每种方法在约占2-3%的测试场景中均占据优势;当我们采用一种在每个场景中选择VLM和ViT分支中更优轨迹的oracle时,可获得上限为93.58 PDMS。RQ3:为充分利用这一观察,我们提出HybridDriveVLA,运行ViT和VLM两个分支,根据学习到的评分器在其端点轨迹之间进行选择,将PDMS提升至92.10。最后,DualDriveVLA实现一种实用的快-慢策略:默认运行ViT,仅当评分器置信度低于阈值时调用VLM;在占15%场景下调用VLM即可实现91.00 PDMS,同时提升吞吐量3.2倍。代码将发布。

关键词

引用

@article{arxiv.2602.10719,
  title  = {From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving},
  author = {Sining Ang and Yuguang Yang and Chenxu Dang and Canyu Chen and Cheng Chi and Haiyan Liu and Xuanyao Mao and Jason Bao and Xuliang and Bingchuan Sun and Yan Wang},
  journal= {arXiv preprint arXiv:2602.10719},
  year   = {2026}
}

备注

22 pages (10 pages main text + 12 pages appendix), 18 figures