中文

一种用于驾驶视频中危险目标定位的注意力引导多流特征融合网络

计算机视觉与模式识别 2022-09-19 v1

摘要

在车载行车记录仪(dashcam)所拍摄的视频中检测危险交通参与者,对于在复杂环境中实现安全导航至关重要。与事故相关的视频仅占驾驶视频大数据的极小部分,且事故前的瞬态过程高度动态且复杂。此外,危险与非危险交通参与者在外观上可能相似。这些使得驾驶视频中的危险目标定位尤为困难。为此,本文提出一种注意力引导多流特征融合网络(AM-Net),用于从行车记录仪视频中定位危险交通参与者。两个门控循环单元(GRU)网络利用从连续视频帧中提取的目标边界框与光流特征,捕捉用于区分危险交通参与者的时空线索。与GRU耦合的注意力模块学习关注与事故相关的交通参与者。通过融合两路特征,AM-Net预测视频中交通参与者的风险评分。为支撑本研究,本文还引入了一个称为危险目标定位(ROL)的基准数据集。该数据集包含事故、目标和场景级属性的空间、时间以及类别标注。所提出的AM-Net在ROL数据集上取得了85.73% AUC的优异性能。同时,AM-Net在DoTA数据集上以6.3% AUC的优势超越当前视频异常检测的最优方法。一项充分的消融研究通过评估各组成部分的贡献进一步揭示了AM-Net的优势。

关键词

引用

@article{arxiv.2209.07922,
  title  = {An Attention-guided Multistream Feature Fusion Network for Localization of Risky Objects in Driving Videos},
  author = {Muhammad Monjurul Karim and Ruwen Qin and Zhaozheng Yin},
  journal= {arXiv preprint arXiv:2209.07922},
  year   = {2022}
}

备注

Submitted to IEEE-T-ITS