中文

基于局部视觉变压器的交通标志识别

计算机视觉与模式识别 2023-11-14 v1

摘要

交通标志识别是自动驾驶汽车和驾驶辅助系统的关键方面,交通标志识别等机器视觉任务已获得显著关注。CNNs已频繁用于机器视觉,但视觉变换器(vision transformers)的引入为全局特征学习提供了替代方法。本文提出一种融合卷积与基于变换器网络两者优势的新型模型用于交通标志识别。所提模型包括用于捕获局部相关性的卷积块和用于学习全局依赖性的基于变换器的块。此外,还引入了局部性模块以增强局部感知。所提模型的性能在Persian交通标志数据集和German交通标志识别基准上进行了评估,并与SOTA卷积和基于变换器的模型进行比较。实验评估表明,带有局部性模块的混合网络在准确率上优于纯基于变换器的模型和某些最佳卷积网络。具体而言,我们提出的最终模型在德国交通标志识别基准上达到99.66%的准确率,在Persian交通标志数据集上达到99.8%,高于最佳卷积模型。此外,它在保持快速推理速度的同时优于现有CNNs和ViTs。因此,所提模型被证明显著更快且更适合真实世界应用。

关键词

引用

@article{arxiv.2311.06651,
  title  = {Traffic Sign Recognition Using Local Vision Transformer},
  author = {Ali Farzipour and Omid Nejati Manzari and Shahriar B. Shokouhi},
  journal= {arXiv preprint arXiv:2311.06651},
  year   = {2023}
}