中文

Shatter and Gather:以文本监督学习指称图像分割

计算机视觉与模式识别 2023-10-25 v2

摘要

指称图像分割,即分割自由形式文本中描述的任意实体的任务,开启了多种视觉应用。然而,该任务的训练数据人工标注成本极高,导致缺乏用于训练的标注数据。我们通过一种弱监督学习方法解决此问题,仅使用训练图像的文本描述作为唯一的监督来源。为此,我们首先提出一个新模型,其在输入图像中发现语义实体,然后将与文本查询相关的此类实体组合以预测指称对象的掩码。我们还提出一个新的损失函数,使得模型无需任何进一步监督即可训练。我们的方法在四个公开的指称图像分割基准上进行了评估,在所有基准上均明显优于针对同一任务的现有方法及近期的开放词汇分割模型。

关键词

引用

@article{arxiv.2308.15512,
  title  = {Shatter and Gather: Learning Referring Image Segmentation with Text Supervision},
  author = {Dongwon Kim and Namyup Kim and Cuiling Lan and Suha Kwak},
  journal= {arXiv preprint arXiv:2308.15512},
  year   = {2023}
}

备注

Accepted to ICCV 2023, Project page: https://southflame.github.io/sag/