中文

RAC3:基于视觉语言模型的自动驾驶检索增强角案例理解

计算机视觉与模式识别 2025-11-18 v4 人工智能

摘要

理解和处理角案例对于确保自动驾驶系统的安全性和可靠性至关重要。视觉语言模型在增强场景理解方面发挥着关键作用,但它们面临着重大挑战,如幻觉和现实基础不足,这损害了它们在关键驾驶场景中的性能。在本工作中,提出了 RAC3,这是一个旨在增强 VLM 在角案例理解中性能的新颖框架。RAC3 集成了一个频率空间融合(FSF)图像编码器、一种用于嵌入模型的跨模态对齐训练方法(包含难负样本和半难负样本挖掘),以及一个基于 K-Means 聚类和分层可导航小世界(HNSW)索引的快速查询与检索流水线。引入了多模态思维链提示策略,以指导推理过程中的类比推理并减少幻觉。此外,RAC3 中集成了更新机制,以确保框架内的持续学习。在 CODA 和 nuScenes 数据集上的大量实验表明,RAC3 在多个下游任务中显著提升了角案例理解能力。与先前最先进的方法相比,RAC3 在 CODA-LM 基准上取得了 74.46 的最高最终得分,并在与 DriveLM 等端到端框架集成时表现出一致的性能提升。这些结果证明了检索增强策略和跨模态对齐对于实现更安全、更可解释的自动驾驶的有效性。

关键词

引用

@article{arxiv.2412.11050,
  title  = {RAC3: Retrieval-Augmented Corner Case Comprehension for Autonomous Driving with Vision-Language Models},
  author = {Yujin Wang and Quanfeng Liu and Jiaqi Fan and Jinlong Hong and Hongqing Chu and Mengjian Tian and Bingzhao Gao and Hong Chen},
  journal= {arXiv preprint arXiv:2412.11050},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Multimedia