DSV-LFS:统一 LLM 驱动的语义线索与视觉特征以实现鲁棒的少样本分割
计算机视觉与模式识别
2025-03-07 v1 机器学习
摘要
少样本语义分割(FSS)旨在使模型仅使用少量标注样本即可分割新颖/未见过的目标类别。然而,当前的 FSS 方法由于特征表示不完整和存在偏差,经常在泛化方面遇到困难,尤其是在支持图像未能捕捉目标类别的全部外观变化时。为了改进 FSS 流水线,我们提出了一种利用大型语言模型(LLM)将通用类别语义信息适配到查询图像的新型框架。此外,该框架采用密集逐像素匹配来识别查询图像与支持图像之间的相似性,从而实现增强的 FSS 性能。受基于推理的分割框架启发,我们的方法 DSV-LFS 在 LLM 词汇表中引入了一个额外的标记,使多模态 LLM 能够从类别描述生成"语义提示"。同时,一个密集匹配模块识别查询图像与支持图像之间的视觉相似性,生成"视觉提示"。然后联合使用这些提示来引导基于提示的解码器,以实现对查询图像的准确分割。在 Pascal- 和 COCO- 基准数据集上的全面实验表明,我们的框架以显著优势达到了最先进性能,展示了对新类别的优越泛化能力和跨多样场景的鲁棒性。源代码位于 \href{https://github.com/aminpdik/DSV-LFS}{https://github.com/aminpdik/DSV-LFS}。
引用
@article{arxiv.2503.04006,
title = {DSV-LFS: Unifying LLM-Driven Semantic Cues with Visual Features for Robust Few-Shot Segmentation},
author = {Amin Karimi and Charalambos Poullis},
journal= {arXiv preprint arXiv:2503.04006},
year = {2025}
}