MaskConver:重新审视纯卷积模型在全景分割中的应用
计算机视觉与模式识别
2023-12-12 v1 人工智能
摘要
近年来,基于Transformer的模型凭借其强大的建模能力以及将语义类和实例类统一表示为全局二值掩码的能力,主导了全景分割领域。在本文中,我们重新审视纯卷积模型,并提出了一种新颖的全景分割架构MaskConver。MaskConver提出通过预测中心点来完全统一事物和填充物的表示。为此,它创建了一个轻量级的类嵌入模块,当多个中心点共存于同一位置时,该模块可以打破关联。此外,我们的研究表明,解码器设计对于确保模型具有足够的上下文以进行准确检测和分割至关重要。我们引入了一个强大的ConvNeXt-UNet解码器,缩小了卷积模型与Transformer模型之间的性能差距。使用ResNet50骨干网络,我们的MaskConver在COCO全景验证集上达到了53.6%的PQ,优于现代卷积模型Panoptic FCN 9.3%,以及基于Transformer的模型如Mask2Former(+1.7% PQ)和kMaX-DeepLab(+0.6% PQ)。此外,使用MobileNet骨干网络的MaskConver达到了37.2%的PQ,在相同FLOPs/延迟约束下比Panoptic-DeepLab提高了+6.4%。进一步优化的MaskConver版本在移动设备上实时运行时达到了29.7%的PQ。代码和模型权重将公开发布。
关键词
引用
@article{arxiv.2312.06052,
title = {MaskConver: Revisiting Pure Convolution Model for Panoptic Segmentation},
author = {Abdullah Rashwan and Jiageng Zhang and Ali Taalimi and Fan Yang and Xingyi Zhou and Chaochao Yan and Liang-Chieh Chen and Yeqing Li},
journal= {arXiv preprint arXiv:2312.06052},
year = {2023}
}
备注
11 pages, 5 figures