中文

基础模型时代下少样本语义分割的新基准

计算机视觉与模式识别 2025-06-04 v3

摘要

少样本语义分割(FSS)是计算机视觉中的一个关键挑战,推动了对从高级元学习技术到简单迁移学习基线等多种方法的广泛研究。随着作为通用特征提取器的视觉基础模型(VFM)的出现,我们试图探索将这些模型适配于 FSS。当前的 FSS 基准侧重于使用少量图像将预训练模型适配至新任务,它们强调域内泛化,这使其不太适合在大规模网络数据集上训练的 VFM。为了解决这一问题,我们提出了一个新颖的现实基准,其包含专为该任务定制的简单直接的适配过程。使用该基准,我们对著名的 VFM 和语义分割模型进行了全面的比较分析。为了评估它们的有效性,我们采用了从线性探测到参数高效微调(PEFT)和全量微调等多种适配方法。我们的发现表明,为分割设计的模型可能会被自监督(SSL)模型超越。另一方面,虽然 PEFT 方法产生了具竞争力的性能,但与其他方法相比,其获得的结果差异甚微,突显了特征提取器在决定结果方面的关键作用。据我们所知,这是关于 VFM 适配 FSS 的首项研究。

关键词

引用

@article{arxiv.2401.11311,
  title  = {A Novel Benchmark for Few-Shot Semantic Segmentation in the Era of Foundation Models},
  author = {Reda Bensaid and Vincent Gripon and François Leduc-Primeau and Lukas Mauch and Ghouthi Boukli Hacene and Fabien Cardinaux},
  journal= {arXiv preprint arXiv:2401.11311},
  year   = {2025}
}