中文

PrAda:用于文本提示分段的少样本视觉适应

计算机视觉与模式识别 2026-05-20 v1

摘要

分段图像是视觉理解的关键任务,但需要大量的像素级标注。基础模型已为在文本提示下预测新类的任务提供了新范式,无需来自目标域的标注。然而,在远离原始预训练的特定目标域上,性能会显著下降。我们研究了现有方法在此类域移情境下的错误,发现误分类而非掩码生成是主要问题。为此,我们提出了面向文本提示分段的少样本视觉适应新问题。此类适应在图像分类领域已有研究,但在分段领域尚未探讨。我们通过原型适应 (PrAda) 方法解决此任务,这是一种参数高效的方法,适用于冻结的文本提示分段模型。我们的做法结合细粒度像素特征和高层 transformer 表示学习类别特定原型,然后通过学习到的重要性因子与原始文本预测融合。此举保留了模型的零样本潜力,同时实现对新域的强适应。在五个基准数据集上的语义、实例和全景分段实验表明,PrAda 相比最先进方法和所提基线显著改进。

关键词

引用

@article{arxiv.2605.19623,
  title  = {PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation},
  author = {Gabriele Rosi and Fabio Cermelli and Carlo Masone and Barbara Caputo},
  journal= {arXiv preprint arXiv:2605.19623},
  year   = {2026}
}

备注

CVPR 2026 Findings. Code: https://github.com/FocoosAI/PrAda