中文

Peekaboo:文本到图像扩散模型是零样本分割器

计算机视觉与模式识别 2023-06-22 v2 计算与语言 机器学习

摘要

近年来,文本到图像扩散模型在根据自然语言提示生成逼真图像方面展现出卓越能力。然而,鲜有工作探索利用这些模型进行语义定位或指代 grounding。在本工作中,我们探究一个现成的、未经定位信息训练的文本到图像扩散模型,如何能在无需分割专用重训练的情况下对各类语义短语进行 grounding。我们引入一种推理时优化过程,能够生成以自然语言提示为条件的分割掩码。我们的方案 Peekaboo 是一种首创的零样本、开放词汇、无监督语义 grounding 技术,利用扩散模型且无需任何训练。我们在 Pascal VOC 数据集上评估 Peekaboo 的无监督语义分割任务,并在 RefCOCO 数据集上评估其指代分割任务,结果显示其具有竞争力。我们还展示了 Peekaboo 如何用于生成带透明度的图像,尽管底层扩散模型仅在 RGB 图像上训练——据我们所知,我们是首个进行此尝试的。请见我们的项目页面及代码:https://ryanndagreat.github.io/peekaboo

关键词

引用

@article{arxiv.2211.13224,
  title  = {Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors},
  author = {Ryan Burgert and Kanchana Ranasinghe and Xiang Li and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2211.13224},
  year   = {2023}
}

备注

19 pages; contains appendix