中文

面向语义图像分割的特征选择 Transformer

计算机视觉与模式识别 2022-04-04 v3

摘要

近来,融合多尺度特征用于语义图像分割引起了越来越多的关注。已有多种工作提出采用渐进式局部或全局融合,但此类特征融合对于建模多尺度上下文特征而言不够丰富。在本工作中,我们聚焦于融合基于 Transformer 骨干网络的多尺度特征用于语义分割,并提出一种特征选择 Transformer(FeSeFormer),其为每个查询特征聚合来自所有尺度(或层级)的特征。具体而言,我们首先提出尺度级特征选择(SFS)模块,该模块可从整个多尺度特征集中为每个尺度选择信息丰富的子集,其中对当前尺度(或层级)重要的特征被选中,冗余特征被丢弃。此外,我们提出全尺度特征融合(FFF)模块,其可自适应地融合所有尺度的特征用于查询。基于所提出的 SFS 和 FFF 模块,我们开发了特征选择 Transformer(FeSeFormer),并在四个具挑战性的语义分割基准上评估了我们的 FeSeFormer,包括 PASCAL Context、ADE20K、COCO-Stuff 10K 和 Cityscapes,优于当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.2203.14124,
  title  = {Feature Selective Transformer for Semantic Image Segmentation},
  author = {Fangjian Lin and Tianyi Wu and Sitong Wu and Shengwei Tian and Guodong Guo},
  journal= {arXiv preprint arXiv:2203.14124},
  year   = {2022}
}