SepViT:可分离视觉 Transformer
计算机视觉与模式识别
2023-06-16 v4
摘要
Vision Transformers 已在一系列视觉任务中取得显著成功。然而,这些 Transformer 常依赖大量计算成本以实现高性能,难以部署在资源受限设备上。为缓解此问题,我们从深度可分离卷积中汲取经验并模仿其思想,设计了一种高效的 Transformer 骨干网络,即可分离视觉 Transformer(Separable Vision Transformer,简称 SepViT)。SepViT 借助深度可分离自注意力,按序在窗口内部及窗口之间实现局部-全局信息交互。新颖的窗口令牌嵌入与分组自注意力分别以可忽略的成本计算窗口间的注意力关系,并建立跨多个窗口的长程视觉交互。在通用视觉基准上的大量实验表明,SepViT 能在性能与延迟间实现最先进(SOTA)的权衡。其中,SepViT 在 ImageNet-1K 分类上取得 84.2% 的 top-1 准确率,同时相较精度相近的方法(如 CSWin)降低 40% 延迟。此外,SepViT 在 ADE20K 语义分割任务上取得 51.0% mIoU,在基于 RetinaNet 的 COCO 检测任务上取得 47.9 AP,在基于 Mask R-CNN 的 COCO 目标检测与实例分割任务上取得 49.4 box AP 与 44.6 mask AP。
引用
@article{arxiv.2203.15380,
title = {SepViT: Separable Vision Transformer},
author = {Wei Li and Xing Wang and Xin Xia and Jie Wu and Jiashi Li and Xuefeng Xiao and Min Zheng and Shiping Wen},
journal= {arXiv preprint arXiv:2203.15380},
year = {2023}
}