中文

用于精确交通标志检测的高效视觉 Transformer

计算机视觉与模式识别 2023-11-03 v1

摘要

本研究论文探讨了自动驾驶车辆与驾驶辅助系统中交通标志检测相关的挑战。开发可靠且高精度的算法对于交通标志识别与检测(TSRD)在多样真实场景中的广泛应用至关重要。然而,受相机运动、恶劣天气条件和光照不足等因素影响的次优交通图像使该任务复杂化。本研究专门聚焦于交通标志检测方法,并引入 Transformer 模型尤其是视觉 Transformer 变体的应用以应对该任务。Transformer 的注意力机制最初为自然语言处理设计,提供了更好的并行效率。视觉 Transformer 已在包括自动驾驶、目标检测、医疗和健康以及国防相关应用在内的多个领域展现出成功。为提升 Transformer 模型的效率,本研究提出一种集成局部性归纳偏置与 Transformer 模块的新策略。这包括引入高效卷积块与局部 Transformer 块,其有效捕捉短期与长期依赖信息,从而同时提升检测速度与精度。实验评估表明,该方法尤其应用于 GTSDB 数据集时取得了显著进展。

关键词

引用

@article{arxiv.2311.01429,
  title  = {Efficient Vision Transformer for Accurate Traffic Sign Detection},
  author = {Javad Mirzapour Kaleybar and Hooman Khaloo and Avaz Naghipour},
  journal= {arXiv preprint arXiv:2311.01429},
  year   = {2023}
}