GPViT:一种具有组传播机制的高分辨率非层次视觉Transformer
计算机视觉与模式识别
2023-04-26 v2 机器学习
摘要
我们提出组传播视觉Transformer(GPViT):一种新颖的非层次(即非金字塔)Transformer模型,专为具备高分辨率特征的一般视觉识别而设计。高分辨率特征(或token)天然适用于涉及感知细粒度细节的任务,如检测与分割,但由于自注意力随规模扩展的方式,在这些特征间交换全局信息在内存与计算上代价高昂。我们提供了一种高效的替代方案——组传播块(GP Block)来交换全局信息。在每个GP Block中,特征首先由固定数量的可学习组token分组;随后我们执行组传播,在分组特征间交换全局信息;最后,更新后分组特征中的全局信息通过Transformer解码器返回图像特征。我们在多种视觉识别任务上评估GPViT,包括图像分类、语义分割、目标检测与实例分割。我们的方法在所有任务上相较先前工作均取得显著性能提升,尤其在需要高分辨率输出的任务上,例如我们的GPViT-L3在ADE20K语义分割上以仅一半参数量超越Swin Transformer-B达2.0 mIoU。项目页:chenhongyiyang.com/projects/GPViT/GPViT
引用
@article{arxiv.2212.06795,
title = {GPViT: A High Resolution Non-Hierarchical Vision Transformer with Group Propagation},
author = {Chenhongyi Yang and Jiarui Xu and Shalini De Mello and Elliot J. Crowley and Xiaolong Wang},
journal= {arXiv preprint arXiv:2212.06795},
year = {2023}
}
备注
Accepted by ICLR 2023. Project Page: chenhongyiyang.com/projects/GPViT/GPViT. Code: https://github.com/ChenhongyiYang/GPViT