用于条件自动驾驶中基于视频的驾驶员状态与生理多任务估计的高效混合专家模型
计算机视觉与模式识别
2026-03-31 v3 人工智能
摘要
道路安全仍然是全球范围内的一个关键挑战,每年约有 135 万人死于交通事故,通常是由于人为失误。随着我们向更高级别的车辆自动化迈进,挑战依然存在,因为自动驾驶可能会在驾驶员从事非驾驶相关任务 (NDRT) 时造成认知过载,或者在驾驶是唯一任务时导致困倦。这迫切需要一种有效的驾驶员监控系统 (DMS),能够在 SAE Level-2/3 自动驾驶情境下评估认知负荷和困倦状态。在本研究中,我们提出了一种新颖的多任务 DMS,称为 VDMoE,它利用 RGB 视频输入来非侵入式地监测驾驶员状态。通过利用关键面部特征以最小化计算负荷,并集成远程光电容积描记术 (rPPG) 以获取生理信息,我们的方法在保持效率的同时提高了检测精度。此外,我们优化了混合专家 (MoE) 框架,以适应多模态输入并提高不同任务间的性能。我们引入了一种新颖的包含先验的正则化方法,使模型输出与统计先验对齐,从而加速收敛并减轻过拟合风险。我们通过创建一个包含 42 名参与者的 RGB 视频和生理指标的新数据集 (MCDD) 以及两个公共数据集来验证我们的方法。我们的发现证明了 VDMoE 在监测驾驶员状态方面的有效性,有助于构建更安全的自动驾驶系统。代码和数据将予以发布。
引用
@article{arxiv.2410.21086,
title = {Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving},
author = {Jiyao Wang and Xiao Yang and Zhenyu Wang and Ximeng Wei and Ange Wang and Dengbo He and Kaishun Wu},
journal= {arXiv preprint arXiv:2410.21086},
year = {2026}
}