中文

视觉-语言模型可从自然驾驶视频中识别分心驾驶行为

计算机视觉与模式识别 2024-03-22 v4

摘要

识别真实驾驶场景中导致分心的活动对于保障道路上驾驶员与行人的安全与可靠至关重要。传统计算机视觉技术通常数据密集,需要大量标注训练数据来检测与分类各类分心驾驶行为,从而限制了其效率与可扩展性。我们旨在开发一种在仅有有限或无需标注训练数据情况下仍能展现鲁棒性能的通用框架。近来,视觉-语言模型提供了大规模视觉-文本预训练,可适配于如分心驾驶活动识别等任务特定学习。视觉-语言预训练模型(如CLIP)在学习自然语言引导的视觉表征方面已显示出显著潜力。本文提出一种基于CLIP的驾驶员活动识别方法,从自然驾驶图像与视频中识别驾驶员分心。CLIP的视觉嵌入提供零样本迁移与基于任务的微调,可对驾驶视频数据中的分心活动进行分类。我们的结果表明,该框架在零样本迁移与基于视频的CLIP预测驾驶员状态方面,在两个公开数据集上达到了最先进(state-of-the-art)性能。我们提出了基于CLIP视觉表征构建的帧级与视频级框架用于分心驾驶检测与分类任务,并报告了结果。

关键词

引用

@article{arxiv.2306.10159,
  title  = {Vision-Language Models can Identify Distracted Driver Behavior from Naturalistic Videos},
  author = {Md Zahid Hasan and Jiajing Chen and Jiyang Wang and Mohammed Shaiqur Rahman and Ameya Joshi and Senem Velipasalar and Chinmay Hegde and Anuj Sharma and Soumik Sarkar},
  journal= {arXiv preprint arXiv:2306.10159},
  year   = {2024}
}

备注

15 pages, 7 figures