中文

具有并行局部与全局自注意力的轻量视觉 Transformer

计算机视觉与模式识别 2023-07-19 v1

摘要

尽管近年来 transformer 架构已主导计算机视觉,但这些模型难以轻易部署于资源受限、需要实时性能的自动驾驶任务硬件上。其计算复杂度和内存需求限制了它们的使用,尤其对于高分辨率输入的应用。在我们的工作中,我们将强大的最先进视觉 Transformer PLG-ViT 重新设计为更紧凑高效的架构,适用于此类任务。我们识别出原始 PLG-ViT 架构中计算昂贵的模块,并提出了若干旨在减少参数量和浮点运算量的重新设计。作为重新设计的结果,我们能够将 PLG-ViT 的规模缩减为原来的 1/5,且性能仅有适度下降。我们提出了两种变体,分别优化参数量与运行时间之间以及参数量与准确率之间的最佳权衡。仅用 500 万参数,我们在 ImageNet-1K 分类基准上达到了 79.5%\% 的 top-1 准确率。我们的网络在 COCO 实例分割等通用视觉基准上展现出优异性能。此外,我们进行了一系列实验,展示了我们的方法在解决专为自动驾驶与交通挑战定制的各类任务中的潜力。

关键词

引用

@article{arxiv.2307.09120,
  title  = {Light-Weight Vision Transformer with Parallel Local and Global Self-Attention},
  author = {Nikolas Ebert and Laurenz Reichardt and Didier Stricker and Oliver Wasenmüller},
  journal= {arXiv preprint arXiv:2307.09120},
  year   = {2023}
}

备注

This paper has been accepted at IEEE Intelligent Transportation Systems Conference (ITSC), 2023