中文

SAM-REF:在交互中引入图像-提示协同以提升分段细节

计算机视觉与模式识别 2025-04-04 v4

摘要

交互式分段是根据用户的交互提示对目标对象的掩码进行分段。存在两种主流策略:早期融合和晚期融合。当前专家模型利用早期融合策略,对图像和提示的组合进行编码以针对所提示的对象,但在图像上进行重复的复杂计算导致延迟较高。晚期融合模型一次性提取图像嵌入,并在后续交互中与提示合并。这种策略避免了冗余的图像特征提取,显著提高了效率。一个最新的数据里程碑是 Segment Anything Model(SAM)。然而,这一策略限制了模型从所提示的目标区域提取详细信息的能力。为解决此问题,我们提出 SAM-REF,一个两阶段细化框架,通过在晚期融合的交互中引入轻量级细化器,充分集成图像和提示,这结合了早期融合的准确度并保持晚期融合的效率。通过大量实验,我们展示了我们的 SAM-REF 模型在大多数指标上均优于当前最先进的方法,而不会牺牲效率。

关键词

引用

@article{arxiv.2408.11535,
  title  = {SAM-REF: Introducing Image-Prompt Synergy during Interaction for Detail Enhancement in the Segment Anything Model},
  author = {Chongkai Yu and Ting Liu and Anqi Li and Xiaochao Qu and Chengjing Wu and Luoqi Liu and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2408.11535},
  year   = {2025}
}