中文

Ref-Diff:基于生成模型的零样本指代图像分割

计算机视觉与模式识别 2023-09-04 v2

摘要

零样本指代图像分割是一项具有挑战性的任务,因其旨在基于给定的指代描述找到实例分割掩码,而无需在此类配对数据上训练。当前零样本方法主要关注使用预训练的判别模型(如 CLIP)。然而,我们观察到生成模型(如 Stable Diffusion)已潜在地理解了各种视觉元素与文本描述之间的关系,而这在该任务中鲜有探究。本工作中,我们为此任务引入一种新颖的指代扩散分割器(Ref-Diff),其利用了生成模型中细粒度的多模态信息。我们证明,在没有提议生成器的情况下,仅生成模型即可达到与现有 SOTA 弱监督模型相当的性能。当我们将生成模型与判别模型结合时,我们的 Ref-Diff 以显著优势超越这些竞争方法。这表明生成模型对该任务同样有益,并可补充判别模型以实现更好的指代分割。我们的代码公开于 https://github.com/kodenii/Ref-Diff。

关键词

引用

@article{arxiv.2308.16777,
  title  = {Ref-Diff: Zero-shot Referring Image Segmentation with Generative Models},
  author = {Minheng Ni and Yabo Zhang and Kailai Feng and Xiaoming Li and Yiwen Guo and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2308.16777},
  year   = {2023}
}