中文

PoseViNet:基于多视角姿态估计和视觉变换器的分心驾驶员动作识别框架

计算机视觉与模式识别 2023-12-25 v1

摘要

驾驶员分心是交通事故的主要原因。根据美国国家公路交通安全管理局的一项研究,在驾驶车辆时进行诸如操作车内菜单、进食或饮水、或进行电话交谈等活动可能是驾驶员分心的重要来源。基于此,本文提出了一种利用多视角驾驶员动作图像检测驾驶员分心的新方法。所提出的方法是一个基于视觉变换器的框架,结合了姿态估计和动作推理,即PoseViNet。添加姿态信息的动机是使变换器能够更多地关注关键特征。因此,该框架更善于识别关键动作。使用代表驾驶员10种行为的SFD3数据集,将所提出的框架与各种最先进的模型进行了比较。比较发现,PoseViNet优于这些模型。所提出的框架还使用代表驾驶员16种行为的SynDD1数据集进行了评估。结果,PoseViNet在具有挑战性的数据集上达到了97.55%的验证准确率和90.92%的测试准确率。

关键词

引用

@article{arxiv.2312.14577,
  title  = {PoseViNet: Distracted Driver Action Recognition Framework Using Multi-View Pose Estimation and Vision Transformer},
  author = {Neha Sengar and Indra Kumari and Jihui Lee and Dongsoo Har},
  journal= {arXiv preprint arXiv:2312.14577},
  year   = {2023}
}

备注

This is revised draft submitted to IEEE Sensors Journal