基于四维卷积Swin Transformer的小样本分割代价聚合
计算机视觉与模式识别
2022-07-25 v1
摘要
本文提出了一种新颖的代价聚合网络,称为基于Transformer的体素聚合(VAT),用于小样本分割。利用Transformer可通过全局感受野上的自注意力机制使相关性图聚合受益。然而,为Transformer处理而对相关性图进行分块(tokenization)可能带来损害,因为分块边界处的不连续性减少了分块边缘附近的局部上下文并降低了归纳偏置。为解决此问题,我们提出了一种四维卷积Swin Transformer,其中在高维Swin Transformer之前接入一系列小核卷积,为所有像素赋予局部上下文并引入卷积归纳偏置。我们还通过在金字塔结构中应用Transformer来进一步提升聚合性能,其中较粗层级的聚合引导较细层级的聚合。随后在解码器中借助查询的外观嵌入对Transformer输出中的噪声进行滤波。凭借该模型,我们在所有小样本分割标准基准上均取得了新的最优(state-of-the-art)结果。研究还表明,VAT在语义对应任务上也达到了最优性能,而代价聚合在该任务中同样起着核心作用。
引用
@article{arxiv.2207.10866,
title = {Cost Aggregation with 4D Convolutional Swin Transformer for Few-Shot Segmentation},
author = {Sunghwan Hong and Seokju Cho and Jisu Nam and Stephen Lin and Seungryong Kim},
journal= {arXiv preprint arXiv:2207.10866},
year = {2022}
}
备注
Code and trained models are available at https://seokju-cho.github.io/VAT/ . This is ECCV'22 camera-ready version, which is revised from arXiv:2112.11685