中文

K-Net:迈向统一的图像分割

计算机视觉与模式识别 2021-11-02 v2 人工智能

摘要

尽管语义分割、实例分割和全景分割之间存在内在联系,但它们一直使用不同且专门的框架来处理。本文提出了一个统一、简单且有效的框架,用于这些本质相似的任务。该框架名为 K-Net,通过一组可学习的核(kernel)一致地分割实例和语义类别,其中每个核负责为潜在实例或stuff类生成掩码。为缓解区分不同实例的困难,我们提出了一种核更新策略,使每个核在输入图像中基于其有意义的组而动态且条件化。K-Net 可通过二分匹配以端到端方式训练,其训练和推理天然无需 NMS 和边界框。无需额外技巧,K-Net 在 MS COCO test-dev 划分上以 55.2% PQ 超越此前所有已发表的全景分割单模型 SOTA 结果,在 ADE20K val 划分上以 54.3% mIoU 超越语义分割 SOTA 结果。其实例分割性能与 Cascade Mask R-CNN 在 MS COCO 上相当,且推理速度快 60%–90%。代码和模型将发布于 https://github.com/ZwwWayne/K-Net/。

关键词

引用

@article{arxiv.2106.14855,
  title  = {K-Net: Towards Unified Image Segmentation},
  author = {Wenwei Zhang and Jiangmiao Pang and Kai Chen and Chen Change Loy},
  journal= {arXiv preprint arXiv:2106.14855},
  year   = {2021}
}

备注

Camera ready for NeurIPS2021