中文

VRU-Accident:面向暴露于危险场景的鲁道用户 (VRU) 的视频问答与密集描述基准

计算机视觉与模式识别 2025-07-23 v2

摘要

确保鲁道用户(如行人和骑行者)的安全是自动驾驶系统面临的关键挑战,因为涉及 VRU 的碰撞往往会导致严重或致命后果。虽然多模态大语言模型 (MLLM) 在增强自动驾驶车辆的场景理解和决策方面显示出前景,但目前尚无基准能定量评估其在涉及 VRU 的复杂、安全关键场景中推理能力。为此,我们提出了 VRU-Accident,一个大型视觉语言基准,用于评估 MLLM 在涉及 VRU 的高风险交通场景中的表现。VRU-Accident 包含 1K 真实世界的 dashcam 事故视频,标注了 6K 组多选问答对(涵盖 6 个安全关键类别,提供 24K 个候选选项和 3.4K 个唯一答案),以及 1K 组密集场景描述。与先前工作不同,本基准明确聚焦于 VRU-vehicle 事故,提供捕捉事故空间时间动力学和因果语义的细粒度标注。为评估当前 MLLM 的水平,我们对 17 个最先进模型在多选 VQA 任务和密集描述任务上进行了全面评估。我们的发现表明,尽管 MLLM 在视觉关联属性方面表现合理,但在推理和描述事故原因、类型及可预防性方面仍面临重大挑战。

关键词

引用

@article{arxiv.2507.09815,
  title  = {VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding},
  author = {Younggun Kim and Ahmed S. Abdelrahman and Mohamed Abdel-Aty},
  journal= {arXiv preprint arXiv:2507.09815},
  year   = {2025}
}

备注

22 pages, 11 figures, 5 tables