中文

基于掩码多头自注意力的鲁棒多视角多模态驾驶员监测系统

计算机视觉与模式识别 2025-03-27 v1

摘要

驾驶员监测系统(DMSs)对于 L2+ 自动驾驶车辆的安全接管动作至关重要。最先进的 DMS 利用安装于不同位置的多个传感器监测驾驶员与车内场景,并采用决策级融合来整合这些异构数据。然而,该融合方法可能未充分利用不同数据源的互补性,且可能忽视其相对重要性。为解决这些局限,我们提出了一种基于通过多头自注意力(MHSA)的特征级融合的新型多视角多模态驾驶员监测系统。我们通过将其与四种替代融合策略(Sum、Conv、SE 和 AFF)比较来展示其有效性。我们还提出了一种新颖的 GPU 友好监督对比学习框架 SuMoCo 以学习更好的表征。此外,我们对 DAD 数据集的测试划分进行了细粒度处理,以实现驾驶员活动的多类识别。在该增强数据库上的实验表明:1)所提出的基于 MHSA 的融合方法(AUC-ROC:97.0%)优于所有基线与先前方法;2)使用块掩码训练 MHSA 可提升其针对模态/视角崩溃的鲁棒性。代码与标注已公开可用。

关键词

引用

@article{arxiv.2304.06370,
  title  = {Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention},
  author = {Yiming Ma and Victor Sanchez and Soodeh Nikan and Devesh Upadhyay and Bhushan Atote and Tanaya Guha},
  journal= {arXiv preprint arXiv:2304.06370},
  year   = {2025}
}

备注

9 pages (1 for reference); accepted by the 6th Multimodal Learning and Applications Workshop (MULA) at CVPR 2023