用于提升交通安全的多模态大语言模型:综合综述与未来趋势
计算机视觉与模式识别
2025-04-24 v1 计算与语言
摘要
交通安全仍是全球面临的重大挑战,传统的高级车辆辅助系统(ADAS)往往在动态真实场景中因感知处理碎片化且易受对抗性条件影响而难以发挥作用。本文综述了多模态大语言模型(MLLMs)在缓解这些局限性方面的变革性潜力,通过整合跨模态数据(如视觉、空间和环境输入)实现整体场景理解。通过对MLLM方法的全面分析,我们突出了其在增强感知、决策和对抗鲁棒性方面的能力,同时审查了关键数据集(如KITTI、DRAMA、ML4RoadSafety)在推动研究进展中的作用。此外,我们概述了未来方向,包括实时边缘部署、因果驱动推理和人类AI协作。通过将MLLMs定位为下一代交通安全系统的基石,本综述强调了其潜力通过提供可扩展、情境感知的解决方案,主动缓解风险并改善整体道路安全。
引用
@article{arxiv.2504.16134,
title = {Multimodal Large Language Models for Enhanced Traffic Safety: A Comprehensive Review and Future Trends},
author = {Mohammad Abu Tami and Mohammed Elhenawy and Huthaifa I. Ashqar},
journal= {arXiv preprint arXiv:2504.16134},
year = {2025}
}