多文本引导的零样本语义分割
计算机视觉与模式识别
2025-11-20 v1
摘要
最近的基于 CLIP 的零样本语义分割方法通过通常使用单个提示(例如类别照片)来引入类别级文本先验,以辅助分割。然而,这些方法常导致目标区域激活不完全,因为单个文本描述无法完全捕捉复杂类别的语义多样性。此外,它们缺乏明确的跨模态交互,且对噪声支持特征十分敏感,进而影响视觉先验质量。为解决这些问题,本文提出了多文本引导的零样本语义分割网络(MTGNet),是一个双分支框架,通过融合多样化文本提示来细化文本先验并指导视觉先验的跨模态优化,以提升分割性能。具体而言,我们设计了多文本先验细化(MTPR)模块,以抑制干扰并聚合互补语义线索,以增强前景激活并扩展结构复杂对象的语义覆盖范围。我们引入了文本锚特征融合(TAFF)模块,利用多文本嵌入作为语义锚点,将支持图像中判别性局部原型的特征传递到查询图像,从而提高语义一致性并缓解类别内变异。此外,本文提出了前景置信度加权注意力(FCWA)模块,通过利用支持前景特征内部的自相似性来增强视觉先验的鲁棒性。它自适应地降低不一致区域的权重,有效抑制查询分割过程中的干扰。大量实验表明,MTGNet 在标准 FSS 数据集上取得优异性能。在 1-shot 设置下,PASCAL-5i 达到 76.8% 的 mIoU,COCO-20i 达到 57.4%,在类别内变异较大的折叠中取得显著改进。
引用
@article{arxiv.2511.15515,
title = {Multi-Text Guided Few-Shot Semantic Segmentation},
author = {Qiang Jiao and Bin Yan and Yi Yang and Mengrui Shi and Qiang Zhang},
journal= {arXiv preprint arXiv:2511.15515},
year = {2025}
}