用于通用图像分割的掩码注意力掩码 Transformer
计算机视觉与模式识别
2022-06-17 v3 人工智能
机器学习
摘要
图像分割是对具有不同语义(如类别或实例归属)的像素进行分组,其中每种语义选择定义一个任务。虽然各任务仅语义不同,当前研究聚焦于为每个任务设计专用架构。我们提出掩码注意力掩码 Transformer(Mask2Former),一种能够处理任意图像分割任务(全景、实例或语义)的新架构。其关键组件包括掩码注意力,它通过约束交叉注意力在预测掩码区域内来提取局部特征。除将研究工作量减少至少三倍外,它在四个流行数据集上以显著优势优于最佳专用架构。最值得注意的是,Mask2Former 为全景分割(COCO 上 57.8 PQ)、实例分割(COCO 上 50.1 AP)和语义分割(ADE20K 上 57.7 mIoU)树立了新标杆。
引用
@article{arxiv.2112.01527,
title = {Masked-attention Mask Transformer for Universal Image Segmentation},
author = {Bowen Cheng and Ishan Misra and Alexander G. Schwing and Alexander Kirillov and Rohit Girdhar},
journal= {arXiv preprint arXiv:2112.01527},
year = {2022}
}
备注
CVPR 2022. Project page/code/models: https://bowenc0221.github.io/mask2former