中文

OneFormer:一个 Transformer 统一通用图像分割

计算机视觉与模式识别 2023-01-02 v2

摘要

通用图像分割并非一个新概念。过去几十年中,统一图像分割的尝试包括场景解析、全景分割,以及最近的新全景架构。然而,这些全景架构并未真正统一图像分割,因为它们需要在语义分割、实例分割或全景分割上单独训练才能达到最佳性能。理想情况下,一个真正通用的框架应该只需训练一次,即可在所有三种图像分割任务上达到 SOTA 性能。为此,我们提出了 OneFormer,一个通过多任务一次性训练设计来统一分割的通用图像分割框架。我们首先提出了一种任务条件联合训练策略,使得在单一的多任务训练过程中,能够对每个领域(语义分割、实例分割和全景分割)的真实标签进行训练。其次,我们引入了一个任务 token,根据当前任务对模型进行条件化,使模型具备任务动态性,以支持多任务训练和推理。第三,我们提出在训练期间使用查询文本对比损失,以建立更好的任务间和类别间区分。值得注意的是,尽管专门的 Mask2Former 模型在三个任务上分别训练并消耗了三倍的资源,我们单一的 OneFormer 模型在 ADE20k、CityScapes 和 COCO 上的所有三项分割任务中均优于该模型。采用新的 ConvNeXt 和 DiNAT 主干网络后,我们观察到了更进一步的性能提升。我们相信 OneFormer 是使图像分割更加通用和普及的重要一步。为了支持进一步的研究,我们在 https://github.com/SHI-Labs/OneFormer 开源了我们的代码和模型。

关键词

引用

@article{arxiv.2211.06220,
  title  = {OneFormer: One Transformer to Rule Universal Image Segmentation},
  author = {Jitesh Jain and Jiachen Li and MangTik Chiu and Ali Hassani and Nikita Orlov and Humphrey Shi},
  journal= {arXiv preprint arXiv:2211.06220},
  year   = {2023}
}

备注

Project Page: https://praeclarumjj3.github.io/oneformer