Prompt-Tuning SAM:仅用2048个参数和16张训练图像将通用模型变为专家
计算机视觉与模式识别
2025-04-24 v1
摘要
Segment Anything Model (SAM)广泛用于对自然图像中的 diverse 对象进行分段,使用简单的用户提示(如点或边界框)。然而,SAM在应用于非自然领域(如显微成像)时性能会显著下降。此外,由于SAM的交互式设计,它需要为每个图像和对象提供精确的提示,这在许多自动生物医学应用中难以实现。以往做法通过微调大量参数或适配器层来调整SAM。相比之下,我们表明仅需2048个额外参数即可将SAM转化为特定下游任务的专用模型。我们提出的PTSAM(prompt-tuned SAM)方法采用prompt-tuning技术,对SAM进行任务适配。我们在多个显微和一个医疗数据集上验证了该方法的性能。结果表明,仅对SAM的mask decoder进行prompt-tuning即可实现与领先技术相当的性能,而只需约2000倍更少的可训练参数。对于解决领域差距,我们发现进一步对SAM的image encoder进行prompt-tuning也有益,能将分割精度提升最高可达18%。由于PTSAM可仅用16张标注图像可靠训练,我们发现其在训练数据有限且存在领域迁移的应用中尤为有用。
引用
@article{arxiv.2504.16739,
title = {Prompt-Tuning SAM: From Generalist to Specialist with only 2048 Parameters and 16 Training Images},
author = {Tristan Piater and Björn Barz and Alexander Freytag},
journal= {arXiv preprint arXiv:2504.16739},
year = {2025}
}