中文

ViT-DD:用于半监督驾驶员分心检测的多任务视觉Transformer

计算机视觉与模式识别 2024-02-07 v4

摘要

确保现代驾驶中的交通安全并减少事故至关重要,而计算机视觉技术有潜力为此目标作出重大贡献。本文提出一种用于驾驶员分心检测的多模态视觉Transformer(称为 ViT-DD),其融入了来自分心检测与驾驶员情绪识别相关训练信号的归纳信息。此外,开发了一种自学习算法,可将无情绪标签的驾驶员数据无缝集成进 ViT-DD 的多任务训练过程。实验结果表明,所提 ViT-DD 在 SFDDD 与 AUCDD 数据集上分别超越现有最先进(SOTA)驾驶员分心检测方法 6.5% 与 0.9%。

关键词

引用

@article{arxiv.2209.09178,
  title  = {ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection},
  author = {Yunsheng Ma and Ziran Wang},
  journal= {arXiv preprint arXiv:2209.09178},
  year   = {2024}
}

备注

7 pages, 3 figures, 2 tables