MP-Former:用于图像分割的掩码引导Transformer
计算机视觉与模式识别
2023-03-16 v2
摘要
我们提出了一种掩码引导的Transformer,改进了Mask2Former中用于图像分割的掩码注意力。该改进基于我们的观察:Mask2Former在连续解码器层之间存在不一致的掩码预测,这导致不一致的优化目标和解码器查询的低利用率。为解决此问题,我们提出一种掩码引导训练方法,额外将加噪的地面实况掩码输入掩码注意力,并训练模型重建原始掩码。与掩码注意力中使用的预测掩码相比,地面实况掩码充当引导并有效缓解Mask2Former中不准确掩码预测的负面影响。基于该技术,我们的\M在所有三个图像分割任务(实例、全景和语义)上均取得显著性能提升,在Cityscapes实例和语义分割任务上以ResNet-50骨干网络获得AP和mIoU。我们的方法还显著加速训练,在ADE20K上以ResNet-50和Swin-L骨干网络用一半的训练轮数优于Mask2Former。此外,我们的方法仅在训练时引入少量计算,推理时无额外计算。我们的代码将发布于\url{https://github.com/IDEA-Research/MP-Former}。
引用
@article{arxiv.2303.07336,
title = {MP-Former: Mask-Piloted Transformer for Image Segmentation},
author = {Hao Zhang and Feng Li and Huaizhe Xu and Shijia Huang and Shilong Liu and Lionel M. Ni and Lei Zhang},
journal= {arXiv preprint arXiv:2303.07336},
year = {2023}
}
备注
CVPR 2023