中文

用于自动驾驶的视觉-语言模型:基于 CLIP 的动态场景理解

计算机视觉与模式识别 2025-01-13 v1 人工智能 计算机与社会

摘要

场景理解对于提升驾驶员安全、为自动驾驶车辆(AV)决策生成以人为中心的解释,以及利用人工智能(AI)进行回顾性驾驶视频分析至关重要。本研究开发了一种使用对比语言-图像预训练(CLIP)模型的动态场景检索系统,该系统可针对边缘设备上的实时部署进行优化。所提出的系统优于最先进的上下文学习方法,包括 GPT-4o 的零样本能力,特别是在复杂场景中。通过对 Honda Scenes Dataset 进行帧级分析(该数据集包含约 80 小时的标注驾驶视频,捕捉了多样的真实世界道路和天气条件),我们的研究突出了 CLIP 模型在从自然语言监督中学习视觉概念方面的鲁棒性。结果还表明,微调 CLIP 模型(如 ViT-L/14 和 ViT-B/32)显著改善了场景分类,达到了 91.1% 的最高 F1 分数。这些结果证明了该系统提供快速精确场景识别的能力,可用于满足高级驾驶辅助系统(ADAS)的关键要求。本研究展示了 CLIP 模型为动态场景理解和分类提供可扩展且高效框架的潜力。此外,这项工作通过促进对驾驶员行为、道路条件和安全关键场景的更深入理解,为先进的自动驾驶车辆技术奠定了基础,标志着向更智能、更安全且更具上下文感知能力的自动驾驶系统迈出了重要一步。

关键词

引用

@article{arxiv.2501.05566,
  title  = {Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding},
  author = {Mohammed Elhenawy and Huthaifa I. Ashqar and Andry Rakotonirainy and Taqwa I. Alhadidi and Ahmed Jaber and Mohammad Abu Tami},
  journal= {arXiv preprint arXiv:2501.05566},
  year   = {2025}
}