基于多平移窗口自注意力的场景分割
计算机视觉与模式识别
2022-07-12 v1
摘要
图像中的场景分割是视觉内容理解中基础而又具挑战性的问题,其目标是学习一个模型将每个图像像素分配给一个类别标签。该学习任务面临的挑战之一是考虑空间与语义关系以获得具有描述性的特征表示,因此在场景分割中从多尺度学习特征图是一种常见做法。本文中,我们探索了在多尺度图像窗口内有效使用自注意力来学习描述性视觉特征,进而提出三种不同策略来聚合这些特征图以解码用于密集预测的特征表示。我们的设计基于最近提出的Swin Transformer模型,其完全摒弃了卷积操作。凭借简单而有效的多尺度特征学习与聚合,我们的模型在四个公开场景分割数据集PASCAL VOC2012、COCO-Stuff 10K、ADE20K和Cityscapes上取得了非常有前景的性能。
引用
@article{arxiv.2207.04403,
title = {Self-attention on Multi-Shifted Windows for Scene Segmentation},
author = {Litao Yu and Zhibin Li and Jian Zhang and Qiang Wu},
journal= {arXiv preprint arXiv:2207.04403},
year = {2022}
}