Mask DINO:迈向基于 Transformer 的统一目标检测与分割框架
计算机视觉与模式识别
2022-12-13 v3
摘要
本文提出 Mask DINO,一种统一的目标检测与分割框架。Mask DINO 通过添加支持所有图像分割任务(实例、全景与语义)的掩码预测分支,对 DINO(带改进去噪锚框的 DETR)进行了扩展。它利用 DINO 的查询嵌入与高分辨率像素嵌入图做点积,以预测一组二值掩码。DINO 中的一些关键组件通过共享架构与训练过程被扩展用于分割。Mask DINO 简洁、高效且可扩展,并可从联合的大规模检测与分割数据集中获益。我们的实验表明,Mask DINO 在 ResNet-50 骨干网络以及带 SwinL 骨干的预训练模型上,均显著优于所有现有的专用分割方法。值得注意的是,在十亿参数以下的模型中,Mask DINO 在实例分割(COCO 上 54.5 AP)、全景分割(COCO 上 59.4 PQ)与语义分割(ADE20K 上 60.8 mIoU)上均确立了迄今最佳结果。代码见 \url{https://github.com/IDEACVR/MaskDINO}。
引用
@article{arxiv.2206.02777,
title = {Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation},
author = {Feng Li and Hao Zhang and Huaizhe xu and Shilong Liu and Lei Zhang and Lionel M. Ni and Heung-Yeung Shum},
journal= {arXiv preprint arXiv:2206.02777},
year = {2022}
}