通过 HybridMamba 实现次秒级时序局部化以提升交通事故响应
计算机视觉与模式识别
2025-09-16 v3 人工智能
摘要
在长时段监控视频中检测交通碰撞对于改善应急响应和基础设施规划至关重要,但由于碰撞事件短暂且不频繁,仍面临挑战。我们提出了 HybridMamba—a 一种新型架构,将视觉变换器与状态空间时序建模相结合,以实现高精度的碰撞时间局部化。我们的方法引入多级 token 压缩和层次时序处理,在保持计算效率的同时维持时序分辨率。我们在来自 Iowa 交通部的大型数据集上评估了 HybridMamba,实现了 **1.50 秒**的平均绝对误差(针对 2 分钟视频, 与基线方法显著不同),其中 **65.2%** 的预测在 1 秒内落在真实值附近。它在更小的参数规模(3B vs. 13--72B)下,比最新视频语言模型(如 TimeChat、VideoLLaMA-2)高出最高 **3.95 秒**。我们的结果在各种视频时长(2--40 分钟)和多样环境条件下展示了有效的时序局部化,凸显了 HybridMamba 在交通监控中实现精细时序局部化的潜力,同时也识别了在大规模部署中仍面临的挑战。
引用
@article{arxiv.2504.03235,
title = {Enhancing Traffic Incident Response through Sub-Second Temporal Localization with HybridMamba},
author = {Ibne Farabi Shihab and Sanjeda Akter and Anuj Sharma},
journal= {arXiv preprint arXiv:2504.03235},
year = {2025}
}