超越视觉线索:利用通用语义作为少样本分割的支撑
计算机视觉与模式识别
2025-11-21 v1
摘要
少样本分割(FSS)旨在通过元学习范式,在有限的支撑样本的指导下,对未训练的类别进行分割。现有方法主要从支撑图像中寻找参考作为元指导。然而,由于视觉表征在类别内部的变异,来自支撑图像提取的元信息无法准确指导分割未训练的类别。在本文中,我们认为支撑图像中的参考可能并非关键,支撑作用的关键在于为训练和未训练的类别提供无偏的元指导。我们随后引入了语言驱动属性泛化(LDAG)架构,以利用内在目标属性语言描述构建稳健的支撑策略。具体而言,为获得无偏的支撑表征,我们设计了多属性增强(MaE)模块,通过大型语言模型(LLM)产生目标类别的多个详细属性描述,然后利用多模态匹配构建精细的视觉-文本先验指导。同时,由于文本-视觉模态迁移,属性文本难以促进视觉特征表征,我们设计了多模态属性对齐(MaA)以实现属性文本与视觉特征之间的跨模态互动。实验表明,我们提出的方法在已有方法之上显著优越,并实现了新的最先进性能。代码将公开发布。
引用
@article{arxiv.2511.16435,
title = {Beyond Visual Cues: Leveraging General Semantics as Support for Few-Shot Segmentation},
author = {Jin Wang and Bingfeng Zhang and Jian Pang and Mengyu Liu and Honglong Chen and Weifeng Liu},
journal= {arXiv preprint arXiv:2511.16435},
year = {2025}
}