中文

基于MaskCLIP的开放词汇通用图像分割

计算机视觉与模式识别 2023-06-09 v2

摘要

本文中,我们解决一项新兴的计算机视觉任务——开放词汇通用图像分割,其旨在推理时对基于文本的任意类别描述执行语义/实例/全景分割(背景语义标注+前景实例分割)。我们首先通过直接采用预训练CLIP模型而不进行微调或蒸馏建立了一个基线方法。随后我们开发了MaskCLIP,一种基于Transformer的方法,带有MaskCLIP视觉编码器,该编码器仅含编码模块,将掩码令牌与预训练ViT CLIP模型无缝集成用于语义/实例分割与类别预测。MaskCLIP学习在MaskCLIP视觉编码器内高效且有效地利用预训练的部分/稠密CLIP特征,避免了耗时的师生训练过程。MaskCLIP在ADE20K和PASCAL数据集上优于以往的语义/实例/全景分割方法。我们展示了MaskCLIP在在线自定义类别上的定性示例。项目网站:https://maskclip.github.io。

关键词

引用

@article{arxiv.2208.08984,
  title  = {Open-Vocabulary Universal Image Segmentation with MaskCLIP},
  author = {Zheng Ding and Jieke Wang and Zhuowen Tu},
  journal= {arXiv preprint arXiv:2208.08984},
  year   = {2023}
}

备注

ICML 2023 Camera Ready