中文

使用视觉语言模型获得的通用表示用于驾驶员活动分类

计算机视觉与模式识别 2024-04-24 v1 人工智能 机器学习

摘要

驾驶员活动分类对于确保道路安全至关重要,适用于从驾驶员辅助系统到自动驾驶车辆控制转换的各种应用。在本文中,我们提出了一种新方法,利用从视觉语言模型中获得的通用表示进行驾驶员活动分类。我们的方法采用语义表示晚期融合神经网络(SRLF-Net)处理来自多个视角的同步视频帧。每个帧通过预训练的视觉语言编码器进行编码,将得到的嵌入向量融合以生成类别概率预测。通过利用对比学习获得的视觉语言表示,我们的方法在多样化的驾驶员活动方面实现了稳健的性能。我们在自然驾驶行为识别数据集上对方法进行了评估,证明了在众多类别中具有强大的准确率。我们的结果表明,视觉语言表示为驾驶员监控系统提供了可行的途径,既提供了准确性,又通过自然语言描述符提供了可解释性。

关键词

引用

@article{arxiv.2404.14906,
  title  = {Driver Activity Classification Using Generalizable Representations from Vision-Language Models},
  author = {Ross Greer and Mathias Viborg Andersen and Andreas Møgelmose and Mohan Trivedi},
  journal= {arXiv preprint arXiv:2404.14906},
  year   = {2024}
}