中文

基于层次化推理的视觉语言模型用于 Dashcam 视频事件报告

计算机视觉与模式识别 2025-10-15 v1

摘要

近期的端到端(E2E)自动驾驶技术通过训练多样化的大规模驾驶数据集而取得了进展,但自动驾驶模型在离分布(OOD)场景中仍然表现不佳。COOOL 基准测试旨在填补这一差距,通过鼓励对封闭分类法之外的危险情况进行理解,2COOOL 挑战则进一步扩展到生成可被人类解读的事件报告。我们提出了一种用于从 Dashcam 视频生成事件报告的层次化推理框架,集成帧级描述、事件帧检测以及基于视觉语言模型(VLM)的细粒度推理。我们进一步通过模型集成和盲 A/B 评分选择协议来提高事实准确性和可读性。在官方 2COOOL 开放排行榜上,我们的方法在 29 支队伍中排名第二,取得最佳的 CIDEr-D 分数,生成准确且连贯的事件叙述。这些结果表明,层次化推理与 VLM 的结合是事件事故分析以及更广泛理解安全关键交通事件的有前景的方向。实现代码已公开于 https://github.com/riron1206/kaggle-2COOOL-2nd-Place-Solution。

关键词

引用

@article{arxiv.2510.12190,
  title  = {Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos},
  author = {Shingo Yokoi and Kento Sasaki and Yu Yamaguchi},
  journal= {arXiv preprint arXiv:2510.12190},
  year   = {2025}
}

备注

2nd Place Winner, ICCV 2025 2COOOL Competition