中文

VLADriver-RAG:面向自动驾驶的检索增强视觉-语言-动作模型

计算机视觉与模式识别 2026-05-13 v2 人工智能

摘要

视觉-语言-动作(Vision-Language-Action, VLA)模型已成为端到端自动驾驶的一种有前景的范式,然而它们对隐式参数化知识的依赖限制了在长尾场景中的泛化能力。虽然检索增强生成(Retrieval-Augmented Generation, RAG)通过访问外部专家先验知识提供了一种解决方案,但标准的视觉检索存在高延迟和语义模糊的问题。为应对这些挑战,我们提出了VLADriver-RAG,一个将规划建立在显式的、结构感知的历史知识之上的框架。具体而言,我们通过视觉到场景(Visual-to-Scenario)机制将感官输入抽象为时空语义图,有效过滤视觉噪声。为确保检索相关性,我们采用了一个场景对齐嵌入模型(Scenario-Aligned Embedding Model),该模型利用图-DTW度量对齐来优先考虑内在拓扑一致性,而非表面视觉相似性。然后,这些检索到的先验知识在基于查询的VLA骨干网络中进行融合,以合成精确、解耦的轨迹。在Bench2Drive基准上的大量实验建立了新的最先进水平,实现了89.12的驾驶分数。

关键词

引用

@article{arxiv.2605.08133,
  title  = {VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving},
  author = {Rui Zhao and Haofeng Hu and Zhenhai Gao and Jiaqiao Liu and Gao Fei},
  journal= {arXiv preprint arXiv:2605.08133},
  year   = {2026}
}