中文

TRT-ViT:面向 TensorRT 的视觉 Transformer

计算机视觉与模式识别 2022-07-13 v3

摘要

我们从实际应用的角度重新审视现有的优秀 Transformer。其中大多数甚至不如基础的 ResNets 系列高效,且偏离了真实部署场景。这可能是由于当前衡量计算效率的指标(如 FLOPs 或参数量)具有片面性、次优性且对硬件不敏感。因此,本文将特定硬件上的 TensorRT 延迟直接作为效率指标,其提供了涉及计算能力、内存开销和带宽的更全面反馈。基于一系列对照实验,本工作推导出四条面向 TensorRT 且利于部署的网络设计实用准则,例如在阶段层级采用早期 CNN 与晚期 Transformer、在模块层级采用早期 Transformer 与晚期 CNN。据此,提出了一系列面向 TensorRT 的 Transformer,简称 TRT-ViT。大量实验表明,在图像分类、目标检测和语义分割等多种视觉任务中,TRT-ViT 在延迟/精度权衡上显著优于现有的卷积网络与视觉 Transformer。例如,在 82.7% 的 ImageNet-1k top-1 准确率下,TRT-ViT 比 CSWin 快 2.7×\times,比 Twins 快 2.0×\times。在 MS-COCO 目标检测任务上,TRT-ViT 取得了与 Twins 相当的性能,而推理速度提升了 2.8×\times

关键词

引用

@article{arxiv.2205.09579,
  title  = {TRT-ViT: TensorRT-oriented Vision Transformer},
  author = {Xin Xia and Jiashi Li and Jie Wu and Xing Wang and Xuefeng Xiao and Min Zheng and Rui Wang},
  journal= {arXiv preprint arXiv:2205.09579},
  year   = {2022}
}