探索多模态 AI 在驾驶危险预测中的潜力
计算机视觉与模式识别
2024-07-02 v4
摘要
本文研究预测驾驶员行车过程中可能遭遇的危险这一问题。我们将其形式化为利用车载行车记录仪捕获的单张输入图像来预判即将发生的事故的任务。不同于现有依赖计算模拟或视频异常检测的驾驶危险预测方法,本研究聚焦于基于静态图像的高层推理。该问题需要基于不确定观测预测并推理未来事件,属于视觉溯因推理范畴。为推动这一研究不足领域的进展,我们创建了名为 DHPR(驾驶危险预测与推理)的新数据集。该数据集包含 15K 张街景行车记录仪图像,每幅图像关联一个元组,含车速、假设危险描述及场景中存在的视觉实体。这些由人工标注者标示风险场景并描述数秒后可能发生的潜在事故。我们给出若干基线方法并在数据集上评估其性能,指出遗留问题并探讨未来方向。本研究通过引入新颖的问题形式化与数据集,使研究者得以探索多模态 AI 在驾驶危险预测中的潜力,从而贡献于该领域。
引用
@article{arxiv.2310.04671,
title = {Exploring the Potential of Multi-Modal AI for Driving Hazard Prediction},
author = {Korawat Charoenpitaks and Van-Quang Nguyen and Masanori Suganuma and Masahiro Takahashi and Ryoma Niihara and Takayuki Okatani},
journal= {arXiv preprint arXiv:2310.04671},
year = {2024}
}
备注
Main Paper: 11 pages, Supplementary Materials: 25 pages