中文

M$^2$DAR:基于视觉Transformer的多视角多尺度驾驶员动作识别

计算机视觉与模式识别 2023-05-17 v1

摘要

确保交通安全并预防事故是日常驾驶中的关键目标,而计算机视觉技术的进步可被用于实现该目标。本文提出一种用于未裁剪视频中自然驾驶动作识别与定位的多视角、多尺度框架,即M2^2DAR,特别关注于检测分心驾驶行为。我们的系统具有一个权重共享、基于多尺度Transformer的动作识别网络,可学习鲁棒的层次化表示。此外,我们提出一种由聚合、过滤、合并与选择过程组成的新选举算法,以跨多视角精炼来自动作识别模块的初步结果。在第七届AI City Challenge Track 3数据集上进行的广泛实验证明了我们方法的有效性,我们在A2测试集上取得了0.5921的重叠分数。我们的源代码可在\url{https://github.com/PurdueDigitalTwin/M2DAR}获取。

关键词

引用

@article{arxiv.2305.08877,
  title  = {M$^2$DAR: Multi-View Multi-Scale Driver Action Recognition with Vision Transformer},
  author = {Yunsheng Ma and Liangqi Yuan and Amr Abdelraouf and Kyungtae Han and Rohit Gupta and Zihao Li and Ziran Wang},
  journal= {arXiv preprint arXiv:2305.08877},
  year   = {2023}
}

备注

Accepted in the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)