中文

BiPrompt-SAM:通过点提示与文本提示间的显式选择增强图像分割

计算机视觉与模式识别 2025-09-23 v3 机器学习

摘要

分割是计算机视觉中的一项基础任务,基于提示的方法因其灵活性而日益受到重视。Segment Anything Model (SAM) 擅长点提示分割,而基于文本的模型(通常利用如 BEIT-3 等强大的多模态编码器)则提供了丰富的语义理解。然而,如何有效结合这些互补的模态仍是一个挑战。本文提出了 BiPrompt-SAM,一种采用显式选择机制的新型双模态提示分割框架。我们利用 SAM 根据单点提示生成多个掩码候选的能力,并使用文本引导的掩码(通过 EVF-SAM 与 BEIT-3 生成),以交并比(IoU)为度量,选择在空间上最匹配的点生成掩码。这种方法可以解释为简化的混合专家模型,能够有效融合空间精度与语义上下文,而无需复杂的模型修改。值得注意的是,我们的方法在 Endovis17 医学数据集上仅对每个实例使用单点提示,便实现了强大的零样本性能(89.55% mDice,81.46% mIoU)。与边界框相比,这显著减轻了标注负担,并更好地契合了实际临床工作流程,证明了该方法无需特定领域训练的有效性。在 RefCOCO 系列上,BiPrompt-SAM 分别达到了 87.1%、86.5% 和 85.8% 的 IoU,显著优于现有方法。实验表明,BiPrompt-SAM 在需要空间精度和语义消歧的场景中表现出色,为多模态提示融合提供了一种简单、有效且可解释的视角。

关键词

引用

@article{arxiv.2503.19769,
  title  = {BiPrompt-SAM: Enhancing Image Segmentation via Explicit Selection between Point and Text Prompts},
  author = {Suzhe Xu and Jialin Peng and Chengyuan Zhang},
  journal= {arXiv preprint arXiv:2503.19769},
  year   = {2025}
}

备注

metrics went wrong