中文

TAG:无引导的开放词汇语义分割

计算机视觉与模式识别 2024-03-19 v1

摘要

语义分割是计算机视觉中的一项重要任务,旨在将图像中的每个像素分类至某一类别。然而,传统方法面临重大挑战,包括需要像素级标注和大量训练。此外,由于监督学习使用有限的预定义类别集,模型通常难以处理罕见类别且无法识别新类别。为解决这些问题而提出的无监督与开放词汇分割面临诸多挑战,包括无法为聚类簇分配特定类别标签,以及需要用户提供文本查询进行引导。在此背景下,我们提出一种新方法 TAG,实现了无需训练、无需标注且无需引导的开放词汇语义分割。TAG 利用 CLIP 和 DINO 等预训练模型,在无需额外训练或密集标注的情况下将图像分割为有意义的类别。它从外部数据库检索类别标签,提供了适应新场景的灵活性。我们的 TAG 在未给定类别名称的开放词汇分割任务上,于 PascalVOC、PascalContext 和 ADE20K 数据集取得了 SOTA 结果,即在 PascalVOC 上提升了 +15.3 mIoU。所有代码和数据将发布于 https://github.com/Valkyrja3607/TAG。

关键词

引用

@article{arxiv.2403.11197,
  title  = {TAG: Guidance-free Open-Vocabulary Semantic Segmentation},
  author = {Yasufumi Kawano and Yoshimitsu Aoki},
  journal= {arXiv preprint arXiv:2403.11197},
  year   = {2024}
}

备注

18 pages