ViT-DD:用于半监督驾驶员分心检测的多任务视觉Transformer
计算机视觉与模式识别
2024-02-07 v4
摘要
确保现代驾驶中的交通安全并减少事故至关重要,而计算机视觉技术有潜力为此目标作出重大贡献。本文提出一种用于驾驶员分心检测的多模态视觉Transformer(称为 ViT-DD),其融入了来自分心检测与驾驶员情绪识别相关训练信号的归纳信息。此外,开发了一种自学习算法,可将无情绪标签的驾驶员数据无缝集成进 ViT-DD 的多任务训练过程。实验结果表明,所提 ViT-DD 在 SFDDD 与 AUCDD 数据集上分别超越现有最先进(SOTA)驾驶员分心检测方法 6.5% 与 0.9%。
引用
@article{arxiv.2209.09178,
title = {ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection},
author = {Yunsheng Ma and Ziran Wang},
journal= {arXiv preprint arXiv:2209.09178},
year = {2024}
}
备注
7 pages, 3 figures, 2 tables