面向自动驾驶的检索增强的元决策框架:基于视觉语言模型
计算机视觉与模式识别
2025-03-19 v1 人工智能
摘要
准确理解和决定高层次元行为是确保可靠安全自动驾驶系统的关键。虽然视觉语言模型(VLM)在各种自动驾驶任务中显示出巨大潜力,但常因空间感知不足和幻觉现象而受限,降低其在复杂自动驾驶场景中的有效性。为此,我们提出检索增强决策(RAD)框架,一种新型架构旨在增强VLM可靠生成自动驾驶场景中元行为的能力。RAD利用检索增强生成(RAG)管道,通过由嵌入流、检索流和生成流构成的三阶段过程动态提高决策准确性。此外,我们在来自NuScenes数据集的特定精选数据集上微调VLM,以增强其空间感知和鸟瞰图图像理解能力。在该精选NuScenes数据集上的大量实验评估表明,RAD在匹配准确率、F1分数以及我们自定义的综合评分等关键评估指标上均优于基线方法,凸显其在提升自动驾驶任务中元行为决策方面的有效性。
引用
@article{arxiv.2503.13861,
title = {RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving},
author = {Yujin Wang and Quanfeng Liu and Zhengxin Jiang and Tianyi Wang and Junfeng Jiao and Hongqing Chu and Bingzhao Gao and Hong Chen},
journal= {arXiv preprint arXiv:2503.13861},
year = {2025}
}