中文

无监督的 Segment Anything 模型

计算机视觉与模式识别 2024-07-01 v1 机器学习

摘要

Segment Anything 模型(SAM)需要大量的人工标注工作。我们提出了无监督的 Segment Anything 模型(UnSAM),用于无需人工标注的提示式和自动化整图分割。UnSAM 采用分治策略来“发现”视觉场景的层次结构。首先,我们利用自上而下的聚类方法将无标签图像划分为实例/语义级别的分割区域。对于每个分割区域内的像素,采用自下而上的聚类方法迭代地将其合并成更大的区域,从而形成层次结构。这些无监督的多粒度掩码随后用于监督模型训练。在七个流行数据集上进行评估,UnSAM 以竞争的结果取代监督的 SAM,并在无监督分割方面超越前沿水平 11%。此外,我们展示监督的 SAM 也能从我们的自监督标签中受益。通过将我们的无监督伪掩码整合到 SA-1B 的 ground-truth 掩码中,并仅使用 SA-1B 的 1% 进行训练,轻度半监督的 UnSAM 能够分割监督 SAM 所忽略的实体,在 SA-1B 上超过 SAM 的 AR 超过 6.7%,AP 超过 3.9%。

关键词

引用

@article{arxiv.2406.20081,
  title  = {Segment Anything without Supervision},
  author = {XuDong Wang and Jingfeng Yang and Trevor Darrell},
  journal= {arXiv preprint arXiv:2406.20081},
  year   = {2024}
}

备注

Code: https://github.com/frank-xwang/UnSAM