ContextVLM:基于视觉语言模型的自动驾驶零样本与少样本环境理解
计算机视觉与模式识别
2024-09-04 v1
摘要
近年来,旨在提升交通系统安全性的自动驾驶汽车技术取得了显著发展。尽管自动驾驶汽车已在现实世界中得到一定程度的部署,但全面部署仍需其能够稳健应对暴雨、积雪、低光照、施工区域以及隧道内GPS信号丢失等挑战。为应对这些特定挑战,自动驾驶汽车必须可靠地识别其运行环境的物理属性。在本文中,我们将环境识别定义为准确识别环境属性以便自动驾驶汽车恰当应对的任务。具体而言,我们定义了24种环境上下文,涵盖了自动驾驶汽车必须感知的多种天气、光照、交通和道路状况。出于识别环境上下文的需求,我们创建了一个名为DrivingContexts的环境识别数据集,其中包含超过160万个与自动驾驶相关的上下文-查询对。鉴于传统的监督式计算机视觉方法难以良好地扩展到多种环境,我们提出了一个名为ContextVLM的框架,该框架利用视觉语言模型,通过零样本和少样本方法来检测环境。ContextVLM能够在我们的数据集上以超过95%的准确率可靠地检测相关驾驶环境,同时可在配备4GB Nvidia GeForce GTX 1050 Ti GPU的自动驾驶汽车上实时运行,每次查询延迟为10.5毫秒。
引用
@article{arxiv.2409.00301,
title = {ContextVLM: Zero-Shot and Few-Shot Context Understanding for Autonomous Driving using Vision Language Models},
author = {Shounak Sural and Naren and Ragunathan Rajkumar},
journal= {arXiv preprint arXiv:2409.00301},
year = {2024}
}
备注
Accepted at the 27th IEEE International Conference on Intelligent Transportation Systems (ITSC) 2024