DSDFormer:用于鲁棒高精度驾驶员分心识别的创新 Transformer-Mamba 框架
计算机视觉与模式识别
2024-09-13 v2
摘要
驾驶员分心仍然是交通事故的主要原因,对全球道路安全构成严重威胁。随着智能交通系统的发展,准确且实时地识别驾驶员分心已成为当务之急。然而,现有方法在应对训练数据集中的噪声标签时,难以同时捕获全局上下文和细粒度的局部特征。为了应对这些挑战,我们提出了 DSDFormer,这是一种通过双状态域注意力 (DSDA) 机制整合 Transformer 和 Mamba 架构优势的新型框架,在长距离依赖和详细特征提取之间取得平衡,从而实现鲁棒的驾驶员行为识别。此外,我们引入了时序推理置信学习 (TRCL),这是一种通过利用视频序列中的时空相关性来精炼噪声标签的无监督方法。我们的模型在 AUC-V1、AUC-V2 和 100-Driver 数据集上取得了 SOTA 性能,并在 NVIDIA Jetson AGX Orin 平台上展示了实时处理效率。大量实验结果证实,DSDFormer 和 TRCL 显著提高了驾驶员分心检测的准确性和鲁棒性,为提升道路安全提供了一种可扩展的解决方案。
引用
@article{arxiv.2409.05587,
title = {DSDFormer: An Innovative Transformer-Mamba Framework for Robust High-Precision Driver Distraction Identification},
author = {Junzhou Chen and Zirui Zhang and Jing Yu and Heqiang Huang and Ronghui Zhang and Xuemiao Xu and Bin Sheng and Hong Yan},
journal= {arXiv preprint arXiv:2409.05587},
year = {2024}
}