AccidentBench:车祸及更广领域中多模态理解与推理的基准测试
机器学习
2025-10-01 v1
摘要
车祸等安全关键场景下的多模态模型快速进步,亟需严格评估其理解与推理能力的基准测试。我们提出 AccidentBench,一个大规模基准,融合车祸情景与更广领域的安全关键场景(如空中、水中),强调空间与时间推理(如导航、姿态、多车运动)。基准包含约 2000 条视频及 19000 条人工标注的问答对,覆盖多种视频时长(短/中/长)及难度等级(易/中/难)。任务系统性地探测核心能力:时间、空间、意图理解与推理。通过统一车祸导向的交通场景与空中、水中更广泛的安全关键情景,AccidentBench 提供了综合性、物理驱动的测试平台,用于评估模型在真实世界变异性下的表现。对最新模型(如 Gemini-2.5 Pro 与 GPT-5)的评估显示,哪怕是最强模型在最难的任务与最长视频上的准确率也仅约 18%,揭示了在真实世界时间、空间与意图推理方面存在显著差距。AccidentBench 旨在暴露这些关键缺口,推动开发更安全、更稳健、更贴合真实世界安全关键挑战的多模态模型。代码与数据集已公开:https://github.com/SafeRL-Lab/AccidentBench
引用
@article{arxiv.2509.26636,
title = {AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond},
author = {Shangding Gu and Xiaohan Wang and Donghao Ying and Haoyu Zhao and Runing Yang and Ming Jin and Boyi Li and Marco Pavone and Serena Yeung-Levy and Jun Wang and Dawn Song and Costas Spanos},
journal= {arXiv preprint arXiv:2509.26636},
year = {2025}
}