YawDD+:用于精确打哈欠预测的帧级标注
计算机视觉与模式识别
2026-05-19 v3
摘要
驾驶员疲劳仍是导致交通事故的主要原因之一,占碰撞事故的24%。虽然打哈欠是疲劳的早期行为指标,但现有方法因视频标注数据集中粗粒度时间标注带来的系统性噪声而面临重大挑战。训练鲁棒的机器学习模型需要丰富的监督标签,以帮助从训练数据中学习显著特征。此外,在边缘设备上进行高效的在设备端训练和推理,对于驾驶员疲劳检测任务至关重要,从而实现无需依赖云基础设施的车辆上的准确实时决策。为此,我们开发了一个具有人工在环验证的半自动标注流水线,将 YawDD 视频标注为 YawDD+ 帧级标注,从而实现在 NVIDIA Jetson NANO 等边缘平台上的更准确模型训练。在 YawDD+ 上训练已建立的 MNasNet 分类器和 YOLOv11 检测器架构,使帧准确率相比视频级监督提升了最多6%,mAP 提升了5%,在 Jetson NANO 和 AGX 上分别达到99.34%的分类准确率和95.69%的检测 mAP。此外,MNasNet 仅需8.69分钟/epoch即可完成训练,并在 AGX 上提供高达115帧/秒的推理时间,证实了仅数据质量的提升即可支持无需服务端计算的在设备端驾驶员疲劳监测系统。YawDD+ 数据集和训练模型可在线获取。
引用
@article{arxiv.2512.11446,
title = {YawDD+: Frame-level Annotations for Accurate Yawn Prediction},
author = {Ahmed Mujtaba and Gleb Radchenko and Marc Masana and Radu Prodan},
journal= {arXiv preprint arXiv:2512.11446},
year = {2026}
}
备注
This paper is accepted in the 33rd IEEE International Conference on Image Processing (ICIP) 2026