中文

ZegOT:通过文本提示最优传输实现的零样本分割

计算机视觉与模式识别 2023-05-31 v2 人工智能 机器学习 机器学习

摘要

大规模对比语言-图像预训练(CLIP)近期的成功,使得通过将图像-文本对齐知识迁移到像素级分类来实现零样本语义分割大有前景。然而,现有方法通常需要额外的图像编码器或对 CLIP 模块进行重训练/微调。本文提出一种新颖的基于最优传输的零样本分割(ZegOT)方法,通过最优传输将多个文本提示与冻结的图像嵌入进行匹配。具体而言,我们引入了新颖的多提示最优传输求解器(MPOT),其旨在学习多个文本提示与冻结图像编码器隐藏层视觉特征图之间的最优映射。这一独特映射方法促使每个文本提示有效聚焦于不同的视觉语义属性。在基准数据集上的大量实验表明,我们的方法相较现有零样本语义分割(ZS3)方法取得了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2301.12171,
  title  = {ZegOT: Zero-shot Segmentation Through Optimal Transport of Text Prompts},
  author = {Kwanyoung Kim and Yujin Oh and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2301.12171},
  year   = {2023}
}

备注

18pages, 8 figures