掩码头架构对新类别分割的惊人影响
计算机视觉与模式识别
2021-08-19 v2
摘要
当前的实例分割模型在大规模标注数据集上训练时非常准确,但大规模收集掩码标注成本高昂。我们研究部分监督实例分割问题,其中所有类别均可使用(显著更廉价的)边界框进行训练,而掩码仅用于部分类别。本工作中,我们关注一类流行模型,其对特征图施加可微分裁剪并基于所得裁剪预测掩码。在该类模型下,我们研究 Mask R-CNN 并发现,与其默认的使用候选框与真实框组合训练掩码头的策略不同,仅用真实框训练掩码头可大幅提升其在新类别上的性能。该训练策略还使我们能够利用替代的掩码头架构,为此我们将典型的 2-4 层掩码头替换为显著更深的现成架构(如 ResNet、Hourglass 模型)。尽管许多此类架构在全监督模式下训练时表现相近,我们的主要发现是它们以截然不同的方式泛化到新类别。我们将掩码头泛化到未见类别的能力称为强掩码泛化效应,并表明无需任何特殊模块或损失,我们即可在部分监督 COCO 实例分割基准上取得最先进结果。最后,我们证明该效应具有通用性,在底层检测方法论(包括基于锚、无锚或完全无检测器)及不同骨干网络间均成立。代码与预训练模型见 https://git.io/deepmac。
引用
@article{arxiv.2104.00613,
title = {The surprising impact of mask-head architecture on novel class segmentation},
author = {Vighnesh Birodkar and Zhichao Lu and Siyang Li and Vivek Rathod and Jonathan Huang},
journal= {arXiv preprint arXiv:2104.00613},
year = {2021}
}