中文

用于交通标志检测的金字塔Transformer

计算机视觉与模式识别 2022-07-25 v2

摘要

交通标志检测是自动驾驶汽车和自动驾驶系统视觉系统中的一项重要任务。近来,基于Transformer的新模型在各种计算机视觉任务上取得了令人鼓舞的结果。我们仍观察到原始ViT在交通标志检测中无法产生令人满意的结果,因为数据集总体规模很小且交通标志的类别分布极不平衡。为克服该问题,本文提出一种具有局部性机制的新型金字塔Transformer。具体而言,金字塔Transformer具有若干空间金字塔缩减层,通过空洞卷积将输入图像缩减并嵌入为具有丰富多尺度上下文的令牌。此外,它继承了内在的尺度不变性归纳偏置,能够学习不同尺度物体的局部特征表示,从而增强网络对交通标志尺寸差异的鲁棒性。实验在德国交通标志检测基准(GTSDB)上进行。结果证明了所提模型在交通标志检测任务中的优越性。更具体地,当金字塔Transformer作为主干应用于Cascade RCNN时,在GTSDB上达到77.8% mAP,超越了大多数知名且广泛使用的SOTA模型。

关键词

引用

@article{arxiv.2207.06067,
  title  = {Pyramid Transformer for Traffic Sign Detection},
  author = {Omid Nejati Manzari and Amin Boudesh and Shahriar B. Shokouhi},
  journal= {arXiv preprint arXiv:2207.06067},
  year   = {2022}
}