中文

面向零样态交通事故理解的多阶段视觉语言模型管线

计算机视觉与模式识别 2026-05-29 v1

摘要

我们提出了解决 CVPR 2026 AUTOPILOT 工作坊 ACCIDENT 挑战第一名解答方案,该挑战要求从 CCTV 录像中零样态预测事故发生时间、冲击质心和碰撞类型。在冻结的 Qwen3-VL-32B-Instruct 检查点上构建三阶段管线(全视频联合预测、时间细化和单帧冲击质心定位),随后在 235B 参数的 Mixture-of-Experts 姐妹模型上运行相同管线,采用 9:1 的比例融合两个输出的结果,最后将每个预测点锚定到最近的车辆检测位置。最终系统在 Public LB 获得 0.55469 分,Private LB 获得 0.57080 分,约高出最强基线(Molmo-7B,0.358)的 0.21 分,夺得冠军。我们对每个组件进行消融实验,报告塑造最终设计的消极结果,并在 https://github.com/fuumin621/cvpr2026-accident-1st-place-solution 发布代码。

关键词

引用

@article{arxiv.2605.29325,
  title  = {Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding},
  author = {Fumiya Tatematsu and Fumihiko Takahashi},
  journal= {arXiv preprint arXiv:2605.29325},
  year   = {2026}
}

备注

Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 13. Code: https://github.com/fuumin621/cvpr2026-accident-1st-place-solution