中文

用于通用图像分割的掩码注意力掩码 Transformer

计算机视觉与模式识别 2022-06-17 v3 人工智能 机器学习

摘要

图像分割是对具有不同语义(如类别或实例归属)的像素进行分组,其中每种语义选择定义一个任务。虽然各任务仅语义不同,当前研究聚焦于为每个任务设计专用架构。我们提出掩码注意力掩码 Transformer(Mask2Former),一种能够处理任意图像分割任务(全景、实例或语义)的新架构。其关键组件包括掩码注意力,它通过约束交叉注意力在预测掩码区域内来提取局部特征。除将研究工作量减少至少三倍外,它在四个流行数据集上以显著优势优于最佳专用架构。最值得注意的是,Mask2Former 为全景分割(COCO 上 57.8 PQ)、实例分割(COCO 上 50.1 AP)和语义分割(ADE20K 上 57.7 mIoU)树立了新标杆。

关键词

引用

@article{arxiv.2112.01527,
  title  = {Masked-attention Mask Transformer for Universal Image Segmentation},
  author = {Bowen Cheng and Ishan Misra and Alexander G. Schwing and Alexander Kirillov and Rohit Girdhar},
  journal= {arXiv preprint arXiv:2112.01527},
  year   = {2022}
}

备注

CVPR 2022. Project page/code/models: https://bowenc0221.github.io/mask2former