中文

代价聚合即你所需:少样本分割中的全卷积分块Transformer方法

计算机视觉与模式识别 2021-12-23 v1

摘要

我们引入一种新颖的代价聚合网络,称为基于Transformer的体素聚合(VAT),通过同时使用卷积与transformers高效处理查询与支持间的高维相关图,以解决少样本分割任务。具体而言,我们提出由体素嵌入模块与体素transformer模块构成的编码器:前者将相关图转为更易处理的大小并注入卷积归纳偏置,后者用于代价聚合。我们的编码器具金字塔结构,使较粗层聚合引导较细层并强制学习互补匹配分数。随后我们将输出与投影特征图一并送入感知亲和力的解码器以引导分割过程。结合这些组件,我们实验证明了所提方法的有效性,且我们的方法在少样本分割任务所有标准基准上树立了新SOTA。此外,我们发现尽管并非专为此任务设计,所提方法在语义对应任务标准基准上亦达SOTA性能。我们还提供了广泛的消融研究以验证架构选择。训练权重与代码见:https://seokju-cho.github.io/VAT/。

关键词

引用

@article{arxiv.2112.11685,
  title  = {Cost Aggregation Is All You Need for Few-Shot Segmentation},
  author = {Sunghwan Hong and Seokju Cho and Jisu Nam and Seungryong Kim},
  journal= {arXiv preprint arXiv:2112.11685},
  year   = {2021}
}

备注

The trained weights and codes are available at: https://seokju-cho.github.io/VAT/