MaX-DeepLab:基于掩码 Transformer 的端到端全景分割
计算机视觉与模式识别
2021-07-14 v3
摘要
我们提出 MaX-DeepLab,首个用于全景分割的端到端模型。我们的方法简化了当前严重依赖代理子任务与手工设计组件(如边界框检测、非极大值抑制、实体-物质合并等)的流程。尽管这些子任务由领域专家处理,它们未能全面解决目标任务。相比之下,我们的 MaX-DeepLab 直接用掩码 Transformer 预测带类标号的掩码,并通过二分匹配以受全景质量启发的损失进行训练。我们的掩码 Transformer 采用双路径架构,在 CNN 路径之外引入全局记忆路径,允许与任意 CNN 层直接通信。结果,MaX-DeepLab 在具挑战性的 COCO 数据集上于无框机制中展现出 7.1% PQ 的显著提升,首次缩小了基于框与无框方法间的差距。MaX-DeepLab 的小变体以相近参数量与 M-Adds 比 DETR 提升 3.0% PQ。此外,MaX-DeepLab 在无测试时增强下,于 COCO test-dev 集取得新的最优 51.3% PQ。代码见 https://github.com/google-research/deeplab2。
引用
@article{arxiv.2012.00759,
title = {MaX-DeepLab: End-to-End Panoptic Segmentation with Mask Transformers},
author = {Huiyu Wang and Yukun Zhu and Hartwig Adam and Alan Yuille and Liang-Chieh Chen},
journal= {arXiv preprint arXiv:2012.00759},
year = {2021}
}
备注
CVPR 2021