中文

解耦零样本语义分割

计算机视觉与模式识别 2022-04-18 v2

摘要

零样本语义分割(ZS3)旨在分割训练阶段未见过的新类别。现有工作将 ZS3 表述为像素级零样本分类问题,并借助仅以文本预训练的语言模型将语义知识从已见类迁移到未见类。尽管简单,这种像素级 ZS3 表述在整合常以图文对预训练、且当前展现出巨大视觉任务潜力的视觉-语言模型方面能力有限。受人类常进行分割级语义标注这一观察的启发,我们提出将 ZS3 解耦为两个子任务:1)类不可知的将像素分组为分割区域的任务;2)分割区域上的零样本分类任务。前一任务不涉及类别信息,可直接迁移用于对未见类像素分组;后一任务在分割级进行,为利用以图文对预训练的大规模视觉-语言模型(如 CLIP)用于 ZS3 提供了自然途径。基于该解耦表述,我们提出了一个简单而有效的零样本语义分割模型 ZegFormer,其在 ZS3 标准基准上大幅优于先前方法,例如对未见类按 mIoU 计在 PASCAL VOC 上高出 22 点、在 COCO-Stuff 上高出 3 点。代码将发布于 https://github.com/dingjiansw101/ZegFormer。

关键词

引用

@article{arxiv.2112.07910,
  title  = {Decoupling Zero-Shot Semantic Segmentation},
  author = {Jian Ding and Nan Xue and Gui-Song Xia and Dengxin Dai},
  journal= {arXiv preprint arXiv:2112.07910},
  year   = {2022}
}

备注

Accepted by CVPR 2022