中文

利用图像级标签扩展开放词汇图像分割

计算机视觉与模式识别 2022-07-22 v2

摘要

我们设计了一个开放词汇图像分割模型,将图像组织为由任意文本所指明的有意义区域。近期的工作(CLIP与ALIGN)尽管利用图像级描述标签获得了令人印象深刻的开放词汇分类精度,却无法以像素分割视觉概念。我们认为这些模型缺失了视觉分组这一重要步骤,即在学视觉-语义对齐之前先将像素组织成组。我们提出OpenSeg以解决上述问题,同时仍利用可扩展的描述图像级监督。首先,它学习为可能的组织方式提出分割掩码。然后,它通过将描述中的每个词与一个或多个预测掩码对齐来学习视觉-语义对齐。我们发现掩码表示是支持从描述中学习图像分割的关键,使得扩大数据集与词汇规模成为可能。得益于其可扩展性,OpenSeg在PASCAL数据集上以+19.9 mIoU显著优于近期的开放词汇方法LSeg。

关键词

引用

@article{arxiv.2112.12143,
  title  = {Scaling Open-Vocabulary Image Segmentation with Image-Level Labels},
  author = {Golnaz Ghiasi and Xiuye Gu and Yin Cui and Tsung-Yi Lin},
  journal= {arXiv preprint arXiv:2112.12143},
  year   = {2022}
}

备注

Accepted at ECCV 2022