用于语义图像分割的全 Transformer 网络
计算机视觉与模式识别
2021-12-30 v3
摘要
Transformer 因建模长程依赖的能力,在各种自然语言处理与计算机视觉任务中展现出令人印象深刻的性能。近期进展表明,将此类 Transformer 与基于 CNN 的语义图像分割模型结合极具前景。然而,纯 Transformer 方法在图像分割上能达到何种程度尚缺乏充分研究。本工作中,我们探索一种用于语义图像分割的新颖框架,即基于编码器-解码器的全 Transformer 网络(FTN)。具体而言,我们首先提出金字塔分组 Transformer(PGT)作为编码器,以渐进学习层次化特征,同时降低标准视觉 Transformer(ViT)的计算复杂度。接着,我们提出特征金字塔 Transformer(FPT),从 PGT 编码器的多个层级融合语义级与空间级信息用于语义图像分割。令人惊讶的是,这一简单基线在多个具挑战性的语义分割与人脸解析基准上取得了更优结果,包括 PASCAL Context、ADE20K、COCOStuff 与 CelebAMask-HQ。源代码将于 https://github.com/BR-IDL/PaddleViT 发布。
引用
@article{arxiv.2106.04108,
title = {Fully Transformer Networks for Semantic Image Segmentation},
author = {Sitong Wu and Tianyi Wu and Fangjian Lin and Shengwei Tian and Guodong Guo},
journal= {arXiv preprint arXiv:2106.04108},
year = {2021}
}