视觉Transformer:从语义分割到密集预测
计算机视觉与模式识别
2024-08-05 v4
摘要
视觉Transformer(ViTs)在图像分类中的出现转变了视觉表示学习的方法论。特别地,与CNN跨层递增感受野及其他替代方案(如大核与空洞卷积)相比,ViTs在每层跨所有图像块以全感受野学习视觉表示。本工作中,我们首次探索ViTs用于密集视觉预测(如语义分割)的全局上下文学习潜力。我们的动机是,通过逐层全感受野学习全局上下文,ViTs可捕获更强的长程依赖信息,这对密集预测任务至关重要。我们首先证明,将图像编码为块序列,无局部卷积与分辨率缩减的朴素ViT可为语义分割产生更强的视觉表示。例如,我们的模型称为SEgmentation TRansformer(SETR),在ADE20K上表现出色(50.28% mIoU,提交日测试排行榜首位)并在Cityscapes上具竞争力。然而,基础ViT架构因缺乏金字塔结构、高计算需求与不充分局部上下文,在更广密集预测应用(如目标检测与实例分割)中不足。为以经济方式处理一般密集视觉预测任务,我们进一步公式化了一系列层次局部-全局(HLG)Transformer,其特征为金字塔架构中窗内局部注意力与窗间全局注意力。广泛实验显示,我们的方法在多种密集预测任务(如目标检测、实例分割与语义分割)以及图像分类上取得引人性能。
引用
@article{arxiv.2207.09339,
title = {Vision Transformers: From Semantic Segmentation to Dense Prediction},
author = {Li Zhang and Jiachen Lu and Sixiao Zheng and Xinxuan Zhao and Xiatian Zhu and Yanwei Fu and Tao Xiang and Jianfeng Feng and Philip H. S. Torr},
journal= {arXiv preprint arXiv:2207.09339},
year = {2024}
}
备注
Extended version of CVPR 2021 paper arXiv:2012.15840 Published on International Journal of Computer Vision (2024)