推进自动驾驶车辆智能:用于交通标志识别与鲁棒车道检测的深度学习与多模态 LLM
计算机视觉与模式识别
2025-03-11 v1 人工智能
计算与语言
机器学习
机器人学
摘要
自动驾驶车辆(AVs)需要可靠的交通标志识别和鲁棒的车道检测能力,以确保在复杂和动态环境中安全导航。本文提出了一种集成方法,结合了先进的深度学习技术与多模态大语言模型(MLLMs)以实现全面的道路感知。在交通标志识别方面,我们系统评估了 ResNet-50、YOLOv8 和 RT-DETR,使用 ResNet-50 实现了 99.8% 的 SOTA 性能,使用 YOLOv8 实现了 98.0% 的准确率,而 RT-DETR 尽管计算复杂度较高,也达到了 96.6% 的准确率。在车道检测方面,我们提出了一种由多项式曲线拟合增强的基于 CNN 的分割方法,该方法在良好条件下具有很高的准确率。此外,我们引入了一个轻量级的、基于多模态 LLM 的框架,该框架直接使用小而多样化的数据集进行指令微调,无需初始预训练。该框架能有效处理各种车道类型、复杂交叉路口和汇合区,通过在不利条件下进行推理,显著增强了车道检测的可靠性。尽管可用训练资源有限,我们的多模态方法仍展现出先进的推理能力,实现了 53.87% 的帧总体准确率(FRM)、82.83% 的问题总体准确率(QNS),在晴天和夜间分别达到 99.6% 和 93.0% 的车道检测准确率,并在因下雨(88.4%)或道路退化(95.6%)导致车道不可见时表现出鲁棒的推理性能。所提出的综合框架显著增强了 AV 的感知可靠性,从而为在多样且具挑战性的道路场景下实现更安全的自动驾驶做出了重大贡献。
引用
@article{arxiv.2503.06313,
title = {Advancing Autonomous Vehicle Intelligence: Deep Learning and Multimodal LLM for Traffic Sign Recognition and Robust Lane Detection},
author = {Chandan Kumar Sah and Ankit Kumar Shaw and Xiaoli Lian and Arsalan Shahid Baig and Tuopu Wen and Kun Jiang and Mengmeng Yang and Diange Yang},
journal= {arXiv preprint arXiv:2503.06313},
year = {2025}
}
备注
11 pages, 9 figures