中文

超越掩码:论稀疏监督分割中的指导类型重构

计算机视觉与模式识别 2024-07-17 v1

摘要

现有稀疏分割(FSS)方法主要关注原型特征生成和查询-支持匹配机制。作为生成原型特征的关键提示,图像-掩码类型在支持集中已成为默认设置。然而,诸如图像、文本、框和掩码等多种类型都可以提供有关上下文、类别、局部和形状外观的信息。现有工作聚焦于特定的提示组合,导致FSS走向不同的研究分支。重构FSS中的指导类型预期探索支持集与查询集之间高效的联合表示,催生了针对实际用户定制需求的弱监督或强监督指导研究趋势。在本文中,我们提供了七种指导范式的通用FSS,并开发了一个通用视觉-语言框架(UniFSS),集成文本、掩码、框和图像的提示。利用大规模预训练视觉-语言模型在文本和视觉嵌入方面的优势,UniFSS提出了高层次空间校正和嵌入交互单元,以克服纯视觉匹配方法在面对类别内外观多样性时通常遇到的语义模糊问题。广泛的实验表明,UniFSS显著优于现有最先进的方法。值得注意的是,弱监督的类别感知框范式甚至超过了精细监督的掩码范式。

关键词

引用

@article{arxiv.2407.11503,
  title  = {Beyond Mask: Rethinking Guidance Types in Few-shot Segmentation},
  author = {Shijie Chang and Youwei Pang and Xiaoqi Zhao and Lihe Zhang and Huchuan Lu},
  journal= {arXiv preprint arXiv:2407.11503},
  year   = {2024}
}

备注

Preprint under review