VRP-SAM:带有视觉参考提示的 SAM
计算机视觉与模式识别
2025-11-04 v4
摘要
在本文中,我们提出了一种新颖的视觉参考提示(VRP)编码器,使 Segment Anything Model (SAM) 能够利用标注的参考图像作为分割提示,从而构建 VRP-SAM 模型。本质上,VRP-SAM 可利用标注的参考图像来理解特定对象,并在目标图像中执行针对该特定对象的分割。值得注意的是,VRP 编码器支持多种参考图像标注格式,包括点(point)、框(box)、涂鸦(scribble)和掩码(mask)。VRP-SAM 在保留 SAM 固有优势的同时,扩展了其多功能性和适用性,从而在 SAM 框架内实现了突破,增强了用户友好性。为提升 VRP-SAM 的泛化能力,VRP 编码器采用了元学习策略。为验证 VRP-SAM 的有效性,我们在 Pascal 和 COCO 数据集上进行了广泛的实证研究。值得注意的是,VRP-SAM 以极少的可学习参数在视觉参考分割任务中达到了最先进(state-of-the-art)的性能。此外,VRP-SAM 展现出强大的泛化能力,能够执行未见对象的分割并实现跨域分割。源代码和模型将在 https://github.com/syp2ysy/VRP-SAM 提供。
引用
@article{arxiv.2402.17726,
title = {VRP-SAM: SAM with Visual Reference Prompt},
author = {Yanpeng Sun and Jiahui Chen and Shan Zhang and Xinyu Zhang and Xiaofan Li and Qiang Chen and Gang Zhang and Errui Ding and Jingdong Wang and Zechao Li},
journal= {arXiv preprint arXiv:2402.17726},
year = {2025}
}
备注
Accepted by CVPR 2024; The camera-ready version