K-Net:迈向统一的图像分割
计算机视觉与模式识别
2021-11-02 v2 人工智能
摘要
尽管语义分割、实例分割和全景分割之间存在内在联系,但它们一直使用不同且专门的框架来处理。本文提出了一个统一、简单且有效的框架,用于这些本质相似的任务。该框架名为 K-Net,通过一组可学习的核(kernel)一致地分割实例和语义类别,其中每个核负责为潜在实例或stuff类生成掩码。为缓解区分不同实例的困难,我们提出了一种核更新策略,使每个核在输入图像中基于其有意义的组而动态且条件化。K-Net 可通过二分匹配以端到端方式训练,其训练和推理天然无需 NMS 和边界框。无需额外技巧,K-Net 在 MS COCO test-dev 划分上以 55.2% PQ 超越此前所有已发表的全景分割单模型 SOTA 结果,在 ADE20K val 划分上以 54.3% mIoU 超越语义分割 SOTA 结果。其实例分割性能与 Cascade Mask R-CNN 在 MS COCO 上相当,且推理速度快 60%–90%。代码和模型将发布于 https://github.com/ZwwWayne/K-Net/。
引用
@article{arxiv.2106.14855,
title = {K-Net: Towards Unified Image Segmentation},
author = {Wenwei Zhang and Jiangmiao Pang and Kai Chen and Chen Change Loy},
journal= {arXiv preprint arXiv:2106.14855},
year = {2021}
}
备注
Camera ready for NeurIPS2021