基于多模态大型语言模型优化的驾驶场景技术研究
计算机视觉与模式识别
2025-06-04 v1 人工智能
摘要
随着自动驾驶和辅助驾驶技术的进步,对理解复杂驾驶场景的能力提出了更高的要求。多模态通用大模型已成为应对这一挑战的解决方案。然而,将这些模型应用于垂直领域涉及数据收集、模型训练和部署优化等困难。本文提出了一种在驾驶场景中优化多模态模型的综合方法,包括锥桶检测、交通灯识别、限速建议和交叉路口预警。该方法涵盖了动态提示优化、数据集构建、模型训练和部署等关键方面。具体而言,动态提示优化根据输入图像内容调整提示,以关注影响自车的目标,从而增强模型对特定任务的聚焦和判断能力。数据集通过结合真实数据和合成数据构建,以创建高质量且多样化的多模态训练数据集,提高模型在复杂驾驶环境中的泛化能力。在模型训练中,集成了知识蒸馏、动态微调和量化等先进技术,以降低存储和计算成本,同时提升性能。实验结果表明,这种系统优化方法不仅显著提高了模型在关键任务中的准确率,而且实现了高效的资源利用,为驾驶场景感知技术的实际应用提供了有力支持。
引用
@article{arxiv.2506.02014,
title = {Research on Driving Scenario Technology Based on Multimodal Large Lauguage Model Optimization},
author = {Wang Mengjie and Zhu Huiping and Li Jian and Shi Wenxiu and Zhang Song},
journal= {arXiv preprint arXiv:2506.02014},
year = {2025}
}