基于文本驱动的驾驶视频交通异常检测与时域高频建模
计算机视觉与模式识别
2024-04-16 v2
摘要
驾驶视频中的交通异常检测对于确保自动驾驶和高级驾驶辅助系统的安全至关重要。以往的单一阶段TAD方法主要依赖于帧预测,使其容易受到仪表盘摄像头快速运动引起的动态背景干扰。而两阶段TAD方法通过使用感知算法预先提取与背景无关的特征(如边界框和光流)来减轻这种干扰,看似自然,但容易受到第一阶段感知算法性能的影响,并可能导致误差传播。在本文中,我们引入了TTHF,一种新颖的单一阶段方法,将视频片段与文本提示对齐,为交通异常检测提供了新视角。与以往方法不同,我们的监督信号来源于语言而非正交独热向量,提供了更全面的表示。此外,在视觉表示方面,我们提出在时域中对驾驶视频的高频进行建模。这种建模捕捉了驾驶场景的动态变化,增强了对驾驶行为的感知,并显著改善了交通异常的检测。此外,为了更好地感知各种类型的交通异常,我们精心设计了一种注意力异常聚焦机制,从视觉和语言上引导模型自适应地关注感兴趣的视觉上下文,从而促进交通异常的检测。实验表明,我们提出的TTHF取得了有前景的性能,在DoTA数据集上比最先进的竞争对手高出+5.4% AUC,并在DADA数据集上实现了高泛化能力。
引用
@article{arxiv.2401.03522,
title = {Text-Driven Traffic Anomaly Detection with Temporal High-Frequency Modeling in Driving Videos},
author = {Rongqin Liang and Yuanman Li and Jiantao Zhou and Xia Li},
journal= {arXiv preprint arXiv:2401.03522},
year = {2024}
}
备注
14 pages, 7 figures