中文

用于少样本分割的 Target-aware Bi-Transformer

计算机视觉与模式识别 2023-09-19 v1

摘要

传统语义分割任务需要大量标签,且难以识别未学习过的类别。少样本语义分割 (FSS) 旨在利用有限的带标签支持图像来识别新类别物体的分割,这在现实世界中非常实用。以往研究主要基于原型或相关性。由于同一图像中颜色、纹理和风格相似,我们认为查询图像可被视为其自身的支持图像。本文中,我们提出 Target-aware Bi-Transformer 网络 (TBTNet) 对支持图像与查询图像进行等价处理。还设计了一个有力的 Target-aware Transformer 层 (TTL) 来提取相关性并迫使模型关注前景信息。它将超相关视为一种特征,从而显著减少了特征通道数。得益于该特性,我们的模型是目前最轻量的,仅有 0.4M 可学习参数。此外,与传统方法相比,TBTNet 仅在 10% 至 25% 的训练轮数内即可收敛。在 PASCAL-5i 和 COCO-20i 标准 FSS 基准上的优异性能证明了我们方法的有效性。我们还进行了大量消融实验以评估 Bi-Transformer 架构与 TTL 的有效性。

关键词

引用

@article{arxiv.2309.09492,
  title  = {Target-aware Bi-Transformer for Few-shot Segmentation},
  author = {Xianglin Wang and Xiaoliu Luo and Taiping Zhang},
  journal= {arXiv preprint arXiv:2309.09492},
  year   = {2023}
}