将视觉与语言参考提示融入 SAM 的少样本分割方法
计算机视觉与模式识别
2025-02-04 v1
摘要
分割一切模型(SAM)是一种大规模分割模型,能够借助灵活的提示实现强大的零样本能力。虽然 SAM 可以零样本分割任何物体,但它需要用户为每张目标图像提供提示,且不会为掩码附加任何标签信息。少样本分割模型通过输入带标注的参考图像作为 SAM 的提示,解决了这些问题,无需用户提供提示即可分割目标图像中的特定物体。以往基于 SAM 的少样本分割模型仅使用带标注的参考图像作为提示,由于缺乏参考信息,导致准确率有限。在本文中,我们提出了一种新颖的少样本分割模型——视觉与语言参考提示融入 SAM(VLP-SAM),该模型不仅输入图像,还将语言作为参考信息,从而利用参考图像的视觉信息和文本标签的语义信息。特别地,VLP-SAM 是一种结构简单且可扩展的模型,具有极少的可学习参数,它利用多模态视觉-语言模型将包含视觉-语言信息的提示嵌入输入到 SAM 中。为了证明 VLP-SAM 的有效性,我们在 PASCAL-5i 和 COCO-20i 数据集上进行了实验,在少样本分割任务中取得了高性能,大幅超越了先前最先进的模型(mIoU 分别提升了 6.3% 和 9.5%)。此外,VLP-SAM 在训练数据中未包含的未见物体上展现了其泛化能力。我们的代码可在 https://github.com/kosukesakurai1/VLP-SAM 获取。
引用
@article{arxiv.2502.00719,
title = {Vision and Language Reference Prompt into SAM for Few-shot Segmentation},
author = {Kosuke Sakurai and Ryotaro Shimizu and Masayuki Goto},
journal= {arXiv preprint arXiv:2502.00719},
year = {2025}
}
备注
8 pages, 2 figures