SeMask:用于语义分割的语义掩码 Transformer
计算机视觉与模式识别
2022-04-14 v3 机器学习
摘要
对图像 Transformer 网络编码器部分中预训练主干网络进行微调一直是语义分割任务的传统方法。然而,这种方法忽略了图像在编码阶段所提供的语义上下文。本文主张,在微调时将图像的语义信息融入基于预训练分层 Transformer 的主干网络中可显著提升性能。为此,我们提出 SeMask,一种借助语义注意力操作将语义信息融入编码器的简单而有效的框架。此外,我们在训练时使用轻量级语义解码器,对各阶段的中间语义先验图提供监督。我们的实验表明,融入语义先验仅略微增加 FLOPs 数量,便增强了既有分层编码器的性能。我们将 SeMask 集成到 Swin Transformer 与 Mix Transformer 主干网络中作为编码器并搭配不同解码器,给出了经验证明。我们的框架在 ADE20K 数据集上以 58.25% mIoU 取得新的 SOTA,并在 Cityscapes 数据集的 mIoU 指标上取得超过 3% 的提升。代码与检查点已公开于 https://github.com/Picsart-AI-Research/SeMask-Segmentation 。
引用
@article{arxiv.2112.12782,
title = {SeMask: Semantically Masked Transformers for Semantic Segmentation},
author = {Jitesh Jain and Anukriti Singh and Nikita Orlov and Zilong Huang and Jiachen Li and Steven Walton and Humphrey Shi},
journal= {arXiv preprint arXiv:2112.12782},
year = {2022}
}
备注
Updated experiments with Mix-Transformer (MiT) on ADE20K and added an analysis section