中文

RankSeg:基于图像类别排序的自适应像素分类分割方法

计算机视觉与模式识别 2022-07-21 v2

摘要

分割任务传统上被表述为完全标签的像素分类任务,即从所有图像或视频共享的固定数量预定义语义类别中为每像素预测一个类别。然而,遵循这一表述,标准架构在类别规模扩大(例如超过 1k 水平)的更现实设定下不可避免地会遇到各种挑战。另一方面,在典型图像或视频中,仅出现少数类别,即完全标签的一个小子集。受此直觉启发,本文中我们提出将分割分解为两个子问题:(i)图像级或视频级多标签分类,以及(ii)像素级排序自适应选定标签分类。给定输入图像或视频,我们的框架首先对完全标签进行多标签分类,然后对完全标签排序并根据其类别置信度分数选定一个小子集。随后我们使用一个排序自适应像素分类器,仅对选定标签进行逐像素分类,该分类器使用一组面向排序的可学习温度参数来调整像素分类分数。我们的方法在概念上具通用性,可通过简单地使用轻量多标签分类头和排序自适应像素分类器来改进各种现有分割框架。我们在四项任务上以具竞争力的实验结果展示了框架的有效性,包括图像语义分割、图像全景分割、视频实例分割和视频语义分割。特别地,借助我们的 RankSeg,Mask2Former 在 ADE20K 全景分割 / YouTubeVIS 2019 视频实例分割 / VSPW 视频语义分割基准上分别提升 +0.8% / +0.7% / +0.7%。

关键词

引用

@article{arxiv.2203.04187,
  title  = {RankSeg: Adaptive Pixel Classification with Image Category Ranking for Segmentation},
  author = {Haodi He and Yuhui Yuan and Xiangyu Yue and Han Hu},
  journal= {arXiv preprint arXiv:2203.04187},
  year   = {2022}
}

备注

Accepted at ECCV 2022, Code will be available at: https://github.com/openseg-group/RankSeg