中文

视觉与文本先验引导的掩码组装用于小样本分割及更广泛任务

计算机视觉与模式识别 2023-08-16 v1

摘要

小样本分割(FSS)旨在用少量标注图像分割新类别。由于CLIP在对齐视觉与文本信息方面的优势,集成CLIP可增强FSS模型的泛化能力。然而,即便使用CLIP模型,现有的基于CLIP的FSS方法仍受制于针对基类的偏置预测,这是由类特定特征级交互引起的。为解决此问题,我们提出了视觉与文本先验引导的掩码组装网络(PGMA-Net)。它采用类无关掩码组装过程来缓解偏置,并通过亲和度组装先验将多样化任务统一表述。具体而言,类相关的文本与视觉特征首先被转化为以概率图形式的类无关先验。然后,引入了包含多个通用组装单元(GAU)的先验引导掩码组装模块(PGMAM)。它考虑了多样且即插即用的交互,如视觉-文本、图像间与图像内、免训练以及高阶交互。最后,为确保类无关能力,提出了带通道丢弃机制的层次化解码器(HDCDM),以灵活利用组装掩码与低级特征,而不依赖任何类特定信息。它在FSS任务上取得了新的最先进结果,在1-shot场景下于PASCAL-5i\text{PASCAL-}5^i上mIoU为77.677.6,于COCO-20i\text{COCO-}20^i上为59.459.4。除此之外,我们展示了无需额外重训练,所提PGMA-Net可解决bbox级和跨域FSS、协同分割、零样本分割(ZSS)任务,从而形成一个任意样本分割框架。

关键词

引用

@article{arxiv.2308.07539,
  title  = {Visual and Textual Prior Guided Mask Assemble for Few-Shot Segmentation and Beyond},
  author = {Chen Shuai and Meng Fanman and Zhang Runtong and Qiu Heqian and Li Hongliang and Wu Qingbo and Xu Linfeng},
  journal= {arXiv preprint arXiv:2308.07539},
  year   = {2023}
}