中文

桥接点:基于图的少样本语义“Segment Anything”

计算机视觉与模式识别 2024-10-14 v2

摘要

最近的大规模预训练技术显著提升了视觉基础模型的能力,尤其是Segment Anything Model (SAM),它可以基于点和框提示生成精确的掩码。最近的研究将SAM扩展到少样本语义分割(FSS), focuses on prompt generation for SAM-based automatic semantic segmentation。然而,这些方法在选择合适的提示方面困难,requires specific hyperparameter settings for different scenarios,并且由于过度使用SAM导致单次推理时间较长,结果为低效率和有限的自动化能力。为此,我们提出一种基于图分析的简单而有效的方法。具体而言,一个正负对齐模块动态选择用于生成掩码的点提示,尤其揭示了背景上下文作为负参考的潜力。随后的点-掩码聚类模块基于掩码对点的覆盖情况将掩码和选定点的粒度对齐为有向图。这些点随后通过分解有向图的弱连接组件来高效聚合,构建distinct natural clusters。最后,正向和超车 gating得益于基于图的粒度对齐,聚合高置信度掩码并过滤掉误报掩码用于最终预测,减少了额外超参数的使用和冗余掩码生成。广泛的实验分析覆盖标准FSS、单次部分分割和跨域FSS数据集,验证了所提出方法的有效性和效率, 在COCO-20i上实现58.7%的mIoU,在LVIS-92i上实现35.2%。该代码可在https://andyzaq.github.io/GF-SAM/获取。

关键词

引用

@article{arxiv.2410.06964,
  title  = {Bridge the Points: Graph-based Few-shot Segment Anything Semantically},
  author = {Anqi Zhang and Guangyu Gao and Jianbo Jiao and Chi Harold Liu and Yunchao Wei},
  journal= {arXiv preprint arXiv:2410.06964},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024 as Spotlight