中文

语言与视觉如何meet交通安全:利用多模态大语言模型进行基于视频的交通事故分析

计算机视觉与模式识别 2025-06-18 v1 人工智能 计算与语言

摘要

交通视频的日常不间断、全年无休的 availability(24/7/365)具有巨大的潜力,能够提高交通事故的时空覆盖范围,从而帮助改善交通安全。然而,对数百乃至数千部交通摄像机的 24/7/365 工作协议进行分析仍然极具挑战性,因为现有的基于视觉的方法主要关注从提取原始信息(如车辆轨迹或单个目标检测),然后需要繁琐的后处理才能得出可操作的见解。我们提出 SeeUnsafe,一个新的框架,将多模态大语言模型 (MLLM) 代理集成到视频-based 交通事故分析中,将传统的提取-解释工作流程转化为更具互动性、对话性的方法。这一转变通过自动化诸如视频分类和视觉定位等复杂任务来显著提高处理吞吐量,同时通过实现对多样化交通情景和用户自定义查询的无缝调整来提高适应性。我们的框架采用基于严重程度的聚合策略来处理各长度的视频,并提出一种新型多模态提示,用于生成结构化响应以供审查和评估,并实现细粒度视觉定位。我们引入 IMS(信息匹配得分),这是一种基于 MLLM 的新指标,用于将结构化响应与真实情况一致。我们在Toyota Woven Traffic Safety 数据集上进行了广泛实验,结果表明 SeeUnsafe 有效地通过利用即插即用 MLLM 完成基于事故的视频分类和视觉定位。源代码将在 \url{https://github.com/ai4ce/SeeUnsafe} 上提供。

关键词

引用

@article{arxiv.2501.10604,
  title  = {When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis},
  author = {Ruixuan Zhang and Beichen Wang and Juexiao Zhang and Zilin Bian and Chen Feng and Kaan Ozbay},
  journal= {arXiv preprint arXiv:2501.10604},
  year   = {2025}
}