用于少样本分割的密集跨查询与支持注意力加权掩码聚合
计算机视觉与模式识别
2022-07-19 v1
摘要
少样本语义分割(FSS)的研究引起了广泛关注,其目标是在仅给定目标类别的少量标注支持图像的情况下,分割查询图像中的目标物体。这一具有挑战性任务的关键在于,通过利用查询图像与支持图像之间的细粒度关联,充分利用支持图像中的信息。然而,大多数现有方法要么将支持信息压缩为少量类别级原型,要么在像素级仅使用部分支持信息(例如仅前景),造成了不可忽略的信息损失。本文提出密集像素级跨查询与支持注意力加权掩码聚合(DCAMA),通过配对的查询与支持特征之间的多级像素级关联,充分挖掘前景与背景支持信息。DCAMA 采用 Transformer 架构中的缩放点积注意力实现,将每个查询像素视为一个 token,计算其与所有支持像素的相似度,并将其分割标签预测为所有支持像素标签的加性聚合——以相似度为权重。基于 DCAMA 的独特形式,我们进一步提出用于 n-shot 分割的高效且有效的一次性推理,其中所有支持图像的像素被一次性收集用于掩码聚合。实验表明,我们的 DCAMA 在标准 FSS 基准 PASCAL-5i、COCO-20i 和 FSS-1000 上显著推进了当前最优水平,例如在 1-shot mIoU 上分别比此前最佳记录绝对提升 3.1%、9.7% 和 3.6%。消融实验也验证了 DCAMA 的设计。
引用
@article{arxiv.2207.08549,
title = {Dense Cross-Query-and-Support Attention Weighted Mask Aggregation for Few-Shot Segmentation},
author = {Xinyu Shi and Dong Wei and Yu Zhang and Donghuan Lu and Munan Ning and Jiashun Chen and Kai Ma and Yefeng Zheng},
journal= {arXiv preprint arXiv:2207.08549},
year = {2022}
}
备注
ECCV 2022