中文

SafePLUG:面向交通事故理解的多模态大语言模型,具备像素级洞察与时序锚定能力

计算机视觉与模式识别 2026-04-03 v3 人工智能

摘要

多模态大语言模型(MLLM)在一系列视觉语言任务中取得了显著进展,展现出强大的交通事故理解潜力。然而,现有MLLM在该领域主要聚焦于粗粒度的图像级或视频级理解,常常难以处理细粒度的视觉细节或局部场景组件,限制了其在复杂事故场景中的应用。为此,我们提出SafePLUG,一种新型框架,赋能MLLM具备像素级理解与时序锚定能力,以实现对交通事故的全面分析。SafePLUG支持基于任意形状的视觉提示进行区域感知问答,基于语言指令实现像素级分割,同时识别交通事故场景中时序锚定事件。为推动交通事故理解领域MLLM的发展,我们构建了一个新型数据集,包含围绕多样化事故场景的多模态问答对,具备详细的像素级标注和时序事件边界。实验结果表明,SafePLUG在多个任务上实现了卓越的性能,包括区域问答、像素级分割、时序事件定位和事故事件理解等。这些能力为理解复杂交通场景的细粒度分析奠定了基础,具有提升驾驶安全性和智能交通系统情境感知能力的潜力。代码、数据集和模型 checkpoints 将在 https://zihaosheng.github.io/SafePLUG 公开获取。

关键词

引用

@article{arxiv.2508.06763,
  title  = {SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding},
  author = {Zihao Sheng and Zilin Huang and Yansong Qu and Jiancong Chen and Yuhao Luo and Yen-Jung Chen and Yue Leng and Sikai Chen},
  journal= {arXiv preprint arXiv:2508.06763},
  year   = {2026}
}

备注

The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG