视觉与文本先验引导的掩码组装用于小样本分割及更广泛任务
计算机视觉与模式识别
2023-08-16 v1
摘要
小样本分割(FSS)旨在用少量标注图像分割新类别。由于CLIP在对齐视觉与文本信息方面的优势,集成CLIP可增强FSS模型的泛化能力。然而,即便使用CLIP模型,现有的基于CLIP的FSS方法仍受制于针对基类的偏置预测,这是由类特定特征级交互引起的。为解决此问题,我们提出了视觉与文本先验引导的掩码组装网络(PGMA-Net)。它采用类无关掩码组装过程来缓解偏置,并通过亲和度组装先验将多样化任务统一表述。具体而言,类相关的文本与视觉特征首先被转化为以概率图形式的类无关先验。然后,引入了包含多个通用组装单元(GAU)的先验引导掩码组装模块(PGMAM)。它考虑了多样且即插即用的交互,如视觉-文本、图像间与图像内、免训练以及高阶交互。最后,为确保类无关能力,提出了带通道丢弃机制的层次化解码器(HDCDM),以灵活利用组装掩码与低级特征,而不依赖任何类特定信息。它在FSS任务上取得了新的最先进结果,在1-shot场景下于上mIoU为,于上为。除此之外,我们展示了无需额外重训练,所提PGMA-Net可解决bbox级和跨域FSS、协同分割、零样本分割(ZSS)任务,从而形成一个任意样本分割框架。
引用
@article{arxiv.2308.07539,
title = {Visual and Textual Prior Guided Mask Assemble for Few-Shot Segmentation and Beyond},
author = {Chen Shuai and Meng Fanman and Zhang Runtong and Qiu Heqian and Li Hongliang and Wu Qingbo and Xu Linfeng},
journal= {arXiv preprint arXiv:2308.07539},
year = {2023}
}