中文

GPT-4增强的多模态基础模型用于自动驾驶:利用大语言模型的跨模态注意力

计算机视觉与模式识别 2026-01-19 v1 人工智能

摘要

在自动驾驶汽车领域,准确理解指挥者意图并在视觉上下文中执行语言命令是一项重大挑战。本文介绍了一种先进的编码器-解码器框架,旨在解决自动驾驶中的视觉基础问题。我们的上下文感知视觉基础(CAVG)模型是一个先进系统,集成了五个核心编码器(文本、图像、上下文和跨模态)以及一个多模态解码器。这种集成使CAVG模型能够熟练地捕获上下文语义并学习人类情感特征,并辅以包括GPT-4在内的最先进的大语言模型(LLM)。CAVG的架构通过实现多头跨模态注意力机制和用于注意力调制的区域特定动态(RSD)层得到加强。这种架构设计使模型能够高效处理和解释一系列跨模态输入,从而全面理解语言命令与相应视觉场景之间的关联。在真实世界基准数据集Talk2Car上的实证评估表明,CAVG在预测精度和操作效率方面树立了新标准。值得注意的是,即使在有限训练数据(占完整数据集的50%至75%)的情况下,该模型也表现出卓越的性能。这一特点凸显了其在实际自动驾驶应用中的有效性和部署潜力。此外,CAVG在具有挑战性的场景中表现出显著的鲁棒性和适应性,包括长文本命令解释、低光照条件、模糊命令上下文、恶劣天气条件以及人口密集的城市环境。所提模型的代码可在我们的Github上获取。

关键词

引用

@article{arxiv.2312.03543,
  title  = {GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models},
  author = {Haicheng Liao and Huanming Shen and Zhenning Li and Chengyue Wang and Guofa Li and Yiming Bie and Chengzhong Xu},
  journal= {arXiv preprint arXiv:2312.03543},
  year   = {2026}
}