面向分散驾驶行为的时间局部化的两阶段 Transformer 框架
计算机视觉与模式识别
2026-03-24 v1 人工智能
摘要
从车内视频流中识别危险驾驶行为对于提升道路安全、支持交通违规检测和不安全驾驶动作的识别至关重要。然而,当前的时序动作局部化技术往往难以在准确性和计算效率之间取得平衡。本文开发并评估了一个针对驾驶员监控场景的时序动作局部化框架,特别适合于交通安全检查点或车队管理评估系统等周期性检查场景。我们的 метод 采用两个阶段的管线,将 VideoMAE 基于的特征提取与增强自掩码注意力(AMA)检测器相结合,后者通过空间金字塔池化快速(SPPF)模块捕获多尺度时序特征。实验结果揭示了模型容量与效率之间的明显权衡。在特征提取阶段,ViT-Giant 主干网络提供更高质量的特征表示,测试准确率达 88.09%,而基于 ViT 的变体证明是实用的替代方案,准确率达 82.55%,计算复杂度显著降低(从 Giant 的 1584.06 GFLOPs/segment 降至 101.85 GFLOPs/segment)。在下游局部化任务中,SPPF 的集成在所有配置中均一致提升了性能。值得注意的是,ViT-Giant + SPPF 模型实现了峰值 mAP 92.67%,而轻量级 ViT 配置也保持了稳健的性能。
引用
@article{arxiv.2603.21048,
title = {A Two-stage Transformer Framework for Temporal Localization of Distracted Driver Behaviors},
author = {Gia-Bao Doan and Nam-Khoa Huynh and Minh-Nhat-Huy Ho and Khanh-Thanh-Khoa Nguyen and Thanh-Hai Le},
journal= {arXiv preprint arXiv:2603.21048},
year = {2026}
}
备注
25 pages, 14 figures