中文

视觉主导与新兴多模态方法在分心驾驶检测中的应用:机器学习技术综述

计算机视觉与模式识别 2025-05-06 v1

摘要

尽管在司机监控技术方面取得了进展,分心驾驶仍然是全球道路交通事故和死亡的主要原因。近期的机器学习(ML)和深度学习(DL)研究主要聚焦于视觉数据以检测分心,往往忽视了司机行为复杂的多模态特性。本综述系统性地评估了自 2019 年至 2024 年的 74 篇同行评议研究,这些研究在分心驾驶检测中运用了视觉、传感器、多模态及新兴模态的 ML/DL 技术。综述指出,视觉单模态模型尤其是卷积神经网络(CNN)和时序架构占据显主导地位,虽能实现高准确率,但在现实场景中的可泛化性有限。基于传感器的模型和生理模型通过捕捉内部状态和车辆动力学提供了互补优势,而新兴技术如听觉感知和射频(RF)方法则提供了具备隐私意识的替代方案。多模态架构始终超越单模态基线,展现出增强的鲁棒性、情境感知能力和可扩展性,通过整合多样化的数据流实现综合提升。上述发现强调了需超越视觉单一方法,采纳结合视觉、生理及车辆线索的多模态系统,同时兼顾计算需求的平衡。未来研究应致力于开发轻量级可部署的多模态框架,纳入个性化基准,并建立跨模态基准,以确保在先进驾驶辅助系统(ADAS)和道路安全干预中的实际可靠性。

关键词

引用

@article{arxiv.2505.01973,
  title  = {Visual Dominance and Emerging Multimodal Approaches in Distracted Driving Detection: A Review of Machine Learning Techniques},
  author = {Anthony Dontoh and Stephanie Ivey and Logan Sirbaugh and Andrews Danyo and Armstrong Aboah},
  journal= {arXiv preprint arXiv:2505.01973},
  year   = {2025}
}