中文

OTSeg:面向零样本语义分割的多提示Sinkhorn注意力机制

计算机视觉与模式识别 2024-07-15 v2 人工智能 机器学习 机器学习

摘要

CLIP近期的成功通过将多模态知识迁移到像素级分类,在零样本语义分割中展示了有前景的结果。然而,利用预训练的CLIP知识将文本嵌入与像素嵌入紧密对齐在现有方法中仍存在局限性。为解决这一问题,我们提出了OTSeg,这是一种新颖的多模态注意力机制,旨在增强多个文本提示匹配相关像素嵌入的潜力。我们首先基于最优传输(OT)算法提出了多提示Sinkhorn(MPS),该机制引导多个文本提示选择性地关注图像像素内的各种语义特征。此外,受Sinkformer在单模态设置中成功的启发,我们引入了MPS的扩展,称为多提示Sinkhorn注意力(MPSA),它在多模态设置中有效替代了Transformer框架内的交叉注意力机制。通过大量实验,我们证明OTSeg在三个基准数据集上的零样本语义分割(ZS3)任务中取得了最先进(SOTA)的性能,并带来了显著增益。

关键词

引用

@article{arxiv.2403.14183,
  title  = {OTSeg: Multi-prompt Sinkhorn Attention for Zero-Shot Semantic Segmentation},
  author = {Kwanyoung Kim and Yujin Oh and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2403.14183},
  year   = {2024}
}

备注

ECCV 2024; 23 pages, 8 tables, 8 figures; Project Page: https://cubeyoung.github.io/OTSeg_project/