基于多模态大语言模型的交通事故检测研究
摘要
交通安全仍是全球性的关键问题,及时准确的事故检测对于减少危险和快速应急响应至关重要。基于基础设施的视觉传感器提供了可扩展且高效的连续实时监控解决方案,可直接从捕获的图像中自动检测事故。本研究调查了多模态大语言模型(MLLMs)在使用基础设施摄像头图像检测和描述交通事故方面的零样本能力,从而最大限度地减少对大量标注数据集的依赖。主要贡献包括:(1)使用来自 CARLA 的模拟 DeepAccident 数据集评估 MLLMs,通过受控模拟明确解决缺乏多样化、逼真的基于基础设施的事故数据的问题;(2)在无需先前微调的情况下,对 Gemini 1.5 与 2.0、Gemma 3 和 Pixtral 模型在事故识别和描述能力方面进行性能比较分析;(3)将先进的视觉分析技术(特别是用于目标检测的 YOLO、用于多目标跟踪的 Deep SORT 以及用于实例分割的 Segment Anything (SAM))集成到增强提示中,以提高模型的准确性和可解释性。关键数值结果显示,Pixtral 表现最佳,F1 分数为 0.71,召回率为 83%,而 Gemini 模型通过增强提示获得了更高的精确率(例如,Gemini 1.5 升至 90%),但 F1 分数和召回率出现显著下降。Gemma 3 提供了最均衡的性能,指标波动最小。这些发现证明了将 MLLMs 与先进视觉分析技术相结合的巨大潜力,增强了其在现实世界自动化交通监控系统中的适用性。
引用
@article{arxiv.2509.19096,
title = {Investigating Traffic Accident Detection Using Multimodal Large Language Models},
author = {Ilhan Skender and Kailin Tong and Selim Solmaz and Daniel Watzenig},
journal= {arXiv preprint arXiv:2509.19096},
year = {2025}
}
备注
Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore