中文

PEM:用于图像分割的原型高效 MaskFormer

计算机视觉与模式识别 2024-05-07 v3 人工智能

摘要

近期基于 Transformer 的架构在图像分割领域展现了令人印象深刻的结果。得益于其灵活性,它们在单一统一框架下于语义分割和全景分割等多种分割任务中获得了卓越性能。为实现如此卓越的性能,这些架构采用了密集运算并需要大量计算资源,而这往往不可用,特别是在边缘设备上。为填补这一空白,我们提出了基于原型的高效 MaskFormer (PEM),这是一种可在多种分割任务中运行的高效基于 Transformer 的架构。PEM 提出了一种新颖的基于原型的交叉注意力机制,利用视觉特征的冗余性来限制计算并提高效率,同时不损害性能。此外,PEM 引入了一种高效的多尺度特征金字塔网络,得益于可变形卷积和基于上下文的自调制的结合,能够以高效方式提取具有高语义内容的特征。我们在两个任务(语义分割和全景分割)上对提出的 PEM 架构进行了基准测试,并在 Cityscapes 和 ADE20K 两个不同数据集上进行了评估。PEM 在每个任务和数据集上均表现出卓越性能,优于特定任务架构,同时与计算昂贵的基线相比具有可比性甚至更优。

关键词

引用

@article{arxiv.2402.19422,
  title  = {PEM: Prototype-based Efficient MaskFormer for Image Segmentation},
  author = {Niccolò Cavagnero and Gabriele Rosi and Claudia Cuttano and Francesca Pistilli and Marco Ciccone and Giuseppe Averta and Fabio Cermelli},
  journal= {arXiv preprint arXiv:2402.19422},
  year   = {2024}
}

备注

CVPR 2024. Project page: https://niccolocavagnero.github.io/PEM