中文

窥视一瞥:通过 LoRA 实现少样本语义分割的高效编码器适配

计算机视觉与模式识别 2025-12-12 v1

摘要

少样本语义分割 (FSS) 旨在仅使用小型标注支持集,对查询图像中的新类别进行分割。虽然先前研究主要关注改进解码器,但编码器提取未见类别有意义特征的能力有限仍是关键瓶颈。本文引入 \textit{窥视一瞥} (TaP),一种简单而有效的方法,用于增强 FSS 和跨域 FSS (CD-FSS) 的编码器适应性。TaP 利用低秩适配 (LoRA) 在支持集上对编码器进行微调,最小化计算开销,使其能够快速适应新类别并减轻灾难性遗忘。该方法具有模型无关性,可无缝集成到现有 FSS 流程中。跨多个基准——包括 COCO 20i20^i、Pascal 5i5^i 以及跨域数据集如 DeepGlobe、ISIC 和 Chest X-ray——的广泛实验表明,TaP 在 diverse 模型和 shot 设置下一致性地提高分割性能。尤其在复杂多类别场景中,TaP 均实现了显著提升,凸显其在真实场景中的实用有效性。排位灵敏度分析也表明,即使采用低秩适配,仍可实现卓越性能,确保计算效率。通过解决 FSS 中编码器对新类别泛化的关键限制,TaP 为更稳健、更高效、更通用的分割系统指明了方向。代码已公开于 https://github.com/pasqualedem/TakeAPeek。

关键词

引用

@article{arxiv.2512.10521,
  title  = {Take a Peek: Efficient Encoder Adaptation for Few-Shot Semantic Segmentation via LoRA},
  author = {Pasquale De Marinis and Gennaro Vessio and Giovanna Castellano},
  journal= {arXiv preprint arXiv:2512.10521},
  year   = {2025}
}