中文

用于目标定位与实例分割的简单单尺度视觉Transformer

计算机视觉与模式识别 2022-10-04 v3

摘要

本工作提出一种简单的视觉Transformer设计,作为目标定位与实例分割任务的强基线。Transformer 近期在图像分类任务中展现出有竞争力的性能。为将 ViT 用于目标检测与密集预测任务,许多工作继承了卷积网络的多阶段设计以及高度定制的 ViT 架构。在此设计背后,目标是追求计算成本与多尺度全局上下文有效聚合之间更好的权衡。然而,现有工作将多阶段架构设计作为黑盒方案采用,并未清晰理解其真正益处。本文中,我们全面研究 ViT 上的三种架构设计选择——空间缩减、通道加倍和多尺度特征——并证明原始 ViT 架构无需手工制作多尺度特征即可实现该目标,保持 ViT 原有设计哲学。我们进一步补全一种缩放规则,以优化模型在精度与计算成本/模型大小上的权衡。通过在整个编码器块中利用恒定的特征分辨率和隐藏大小,我们提出一种称为通用视觉Transformer(UViT)的简单紧凑 ViT 架构,其在 COCO 目标检测与实例分割任务上取得强劲性能。

关键词

引用

@article{arxiv.2112.09747,
  title  = {A Simple Single-Scale Vision Transformer for Object Localization and Instance Segmentation},
  author = {Wuyang Chen and Xianzhi Du and Fan Yang and Lucas Beyer and Xiaohua Zhai and Tsung-Yi Lin and Huizhong Chen and Jing Li and Xiaodan Song and Zhangyang Wang and Denny Zhou},
  journal= {arXiv preprint arXiv:2112.09747},
  year   = {2022}
}

备注

ECCV 2022 accepted