面向广义少样本语义分割的概率化原型校准
计算机视觉与模式识别
2025-07-01 v1
摘要
广义少样本语义分割 (GFSS)旨在仅凭少量标注示例即可将分割模型扩展到新类别,同时保持对基线类别的性能。最近,针对GFSS中的新类别通过多模态原型学习提升了泛化能力的预训练视觉语言模型 (VLM)如CLIP被用于此任务。然而,现有基于原型的方法本质上是确定性的,限制了学习到得原型对多样化样本的适应性,尤其是对于标注稀缺的新类别。为此,我们提出FewCLIP——一种基于预训练CLIP多模态原型的概率化原型校准框架,为GFSS提供更灵活的原型学习。具体而言,FewCLIP首先引入原型校准机制,通过可学习的视觉校准原型来细化冻结的文本原型,从而实现更具辨识度和适应性的表征。此外,与确定性原型学习技术不同,FewCLIP在这些校准原型上引入分布正则化。这种概率化表述确保了结构化且考虑不确定性的原型学习,有效缓解了对有限新类别数据的数据过拟合,同时提升了泛化性能。在PASCAL-5和COCO-20数据集上的大量实验表明,我们的方法FewCLIP在两种GFSS设置以及类别增量学习场景下均显著优于当前最先进的方法。代码地址:https://github.com/jliu4ai/FewCLIP。
引用
@article{arxiv.2506.22979,
title = {Probabilistic Prototype Calibration of Vision-Language Models for Generalized Few-shot Semantic Segmentation},
author = {Jie Liu and Jiayi Shen and Pan Zhou and Jan-Jakob Sonke and Efstratios Gavves},
journal= {arXiv preprint arXiv:2506.22979},
year = {2025}
}
备注
ICCV2025 Proceeding