基于Transformer架构的监控视频交通事故检测
计算机视觉与模式识别
2025-12-15 v1 人工智能
摘要
道路交通事故是全球主要的死亡原因之一,其发病率因人口增长、城市化和机动化而持续上升。事故率的上升引发了对交通监控有效性的担忧。传统用于事故检测的计算机视觉方法在时空理解有限和跨域泛化能力不足方面存在困难。Transformer架构的最新进展在建模全局时空依赖关系和并行计算方面表现出色。然而,将这些模型应用于自动交通事故检测受到数据集规模小且缺乏多样性的限制,阻碍了鲁棒、可泛化系统的开发。为弥补这一空白,我们整理了一个全面且平衡的数据集,涵盖了广泛的交通环境、事故类型和上下文变化。利用该数据集,我们提出了一种基于Transformer架构的事故检测模型,该模型使用预提取的空间视频特征。该架构利用卷积层提取单帧内多种模式的局部相关性,同时利用Transformer捕获检索特征之间的序列-时间依赖关系。此外,大多数现有研究忽略了运动线索的整合,而运动线索对于理解动态场景(尤其是在事故期间)至关重要。这些方法通常依赖静态特征或粗糙的时间信息。在本研究中,评估了多种融合运动线索的方法,以确定最有效的策略。在测试的输入方法中,将RGB特征与光流拼接取得了最高的88.3%准确率。研究结果进一步与GPT、Gemini和LLaVA-NeXT-Video等视觉语言模型(VLM)进行了比较,以评估所提方法的有效性。
引用
@article{arxiv.2512.11350,
title = {Surveillance Video-Based Traffic Accident Detection Using Transformer Architecture},
author = {Tanu Singh and Pranamesh Chakraborty and Long T. Truong},
journal= {arXiv preprint arXiv:2512.11350},
year = {2025}
}