中文

与 GPT-4V(ision) 同行:视觉-语言模型在自动驾驶中的早期探索

计算机视觉与模式识别 2023-11-29 v2 人工智能 计算与语言 机器人学

摘要

自动驾驶技术的追求依赖于感知、决策和控制系统的精细集成。传统方法,无论是数据驱动还是基于规则的,都因无法把握复杂驾驶环境的细微差别以及其他道路使用者的意图而受到阻碍。这一直是一个重大瓶颈,尤其在开发安全可靠自动驾驶所需的常识推理和细致场景理解方面。视觉-语言模型(VLM)的出现代表了实现完全自动驾驶车辆的新前沿。本报告对最新的最先进 VLM,即 GPT-4V(ision),及其在自动驾驶场景中的应用进行了详尽评估。我们探索该模型理解和推理驾驶场景、做出决策并最终以驾驶员身份行动的能力。我们的综合测试涵盖从基本场景识别到复杂因果推理和不同条件下的实时决策。我们的发现揭示,与现有自动驾驶系统相比,GPT-4V 在场景理解和因果推理方面表现出优越性能。它展示了处理分布外场景、识别意图以及在真实驾驶语境中做出明智决策的潜力。然而,挑战依然存在,尤其在方向辨别、交通灯识别、视觉定位(vision grounding)和空间推理任务方面。这些局限凸显了进一步研究与开发的必要性。项目现已在 GitHub 上供相关方访问和使用:\url{https://github.com/PJLab-ADG/GPT4V-AD-Exploration}

关键词

引用

@article{arxiv.2311.05332,
  title  = {On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving},
  author = {Licheng Wen and Xuemeng Yang and Daocheng Fu and Xiaofeng Wang and Pinlong Cai and Xin Li and Tao Ma and Yingxuan Li and Linran Xu and Dengke Shang and Zheng Zhu and Shaoyan Sun and Yeqi Bai and Xinyu Cai and Min Dou and Shuanglu Hu and Botian Shi and Yu Qiao},
  journal= {arXiv preprint arXiv:2311.05332},
  year   = {2023}
}