中文

驾驶场景中的认知事故预测:一个多模态基准

计算机视觉与模式识别 2023-06-19 v2 人工智能

摘要

驾驶视频中的交通事故预测旨在提供事故发生的早期预警,并支持安全驾驶系统的决策。以往的工作通常集中于对象级上下文的时空相关性,但它们不能很好地适应固有的长尾数据分布,且易受剧烈环境变化的影响。在本工作中,我们提出了一种认知事故预测(CAP)方法,该方法明确利用受人类启发的对视觉观察的文本描述认知和驾驶员注意力来促进模型训练。具体而言,文本描述为交通场景的主要上下文提供了密集的语义描述指导,而驾驶员注意力则提供了聚焦于与安全驾驶密切相关的关键区域的牵引力。CAP 由一个注意力驱动的文本到视觉的移位融合模块、一个注意力驱动的场景上下文转移模块以及一个驾驶员注意力引导的事故预测模块构成。我们在这些模块中利用注意力机制来探索用于事故预测的核心语义线索。为了训练 CAP,我们扩展了一个现有的自收集 DADA-2000 数据集(每帧均标注了驾驶员注意力),为其添加了事故前视觉观察的事实性文本描述。此外,我们构建了一个新的大规模基准,包含 11,727 个真实场景事故视频,超过 219 万帧(命名为 CAP-DATA),并带有标注的事实-影响-原因-反思描述和时序事故帧标签。基于大量实验,CAP 相较于最先进方法的优越性得到了验证。代码、CAP-DATA 及所有结果将在 \url{https://github.com/JWFanggit/LOTVS-CAP} 发布。

关键词

引用

@article{arxiv.2212.09381,
  title  = {Cognitive Accident Prediction in Driving Scenes: A Multimodality Benchmark},
  author = {Jianwu Fang and Lei-Lei Li and Kuan Yang and Zhedong Zheng and Jianru Xue and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2212.09381},
  year   = {2023}
}