中文

AccidentBlip:基于MA-former的事故预警智能体

人工智能 2025-01-29 v5

摘要

在复杂的交通系统中,准确感知周围环境并预测潜在事故的风险至关重要。现有的大多数事故预测方法基于时间神经网络,如RNN和LSTM。最近的多模态融合方法通过3D目标检测改进车辆定位,并通过计算车辆间距离评估潜在风险。然而,这些时间网络和多模态融合方法存在检测鲁棒性有限和经济成本高的问题。为了应对这些挑战,我们提出了AccidentBlip,一个纯视觉框架,采用我们自行设计的运动事故Transformer(MA-former)处理每一帧视频。与传统的自注意力机制不同,MA-former用时间注意力取代了Q-former的自注意力,使得前一帧对应的查询生成下一帧的查询输入。此外,我们在连续帧的查询之间引入残差模块连接,以增强模型的时间处理能力。对于复杂的V2V和V2X场景,AccidentBlip通过拼接多个摄像头的查询来适应,有效捕捉空间和时间关系。特别地,AccidentBlip在DeepAccident数据集上的事故检测和预测任务中均达到了SOTA性能。它在V2V和V2X场景中也优于当前的SOTA方法,展示了理解复杂现实环境的卓越能力。

关键词

引用

@article{arxiv.2404.12149,
  title  = {AccidentBlip: Agent of Accident Warning based on MA-former},
  author = {Yihua Shao and Yeling Xu and Xinwei Long and Siyu Chen and Ziyang Yan and Yang Yang and Haoting Liu and Yan Wang and Hao Tang and Zhen Lei},
  journal= {arXiv preprint arXiv:2404.12149},
  year   = {2025}
}