中文

高质量分割一切

计算机视觉与模式识别 2023-10-24 v2

摘要

近期的 Segment Anything Model (SAM) 在扩展分割模型规模方面实现了重大飞跃,赋予了强大的零样本能力与灵活的提示能力。尽管使用 11 亿个掩码进行训练,SAM 的掩码预测质量在许多情况下仍显不足,尤其是在处理具有复杂结构的物体时。我们提出 HQ-SAM,使 SAM 具备准确分割任意物体的能力,同时保持 SAM 原有的可提示设计、高效性与零样本泛化能力。我们精心的设计复用并保留了 SAM 的预训练模型权重,仅引入极少的额外参数与计算量。我们设计了一个可学习的高质量输出令牌(High-Quality Output Token),将其注入 SAM 的掩码解码器中,负责预测高质量掩码。我们并非仅将其应用于掩码解码器特征,而是首先将其与早期和最终的 ViT 特征融合以改善掩码细节。为训练我们引入的可学习参数,我们从多个来源组合了一个包含 44K 精细掩码的数据集。HQ-SAM 仅在引入的 44k 掩码数据集上训练,在 8 块 GPU 上仅需 4 小时。我们在涵盖不同下游任务的 10 个多样化分割数据集上展示了 HQ-SAM 的有效性,其中 8 个以零样本迁移协议进行评估。我们的代码与预训练模型见 https://github.com/SysCV/SAM-HQ。

关键词

引用

@article{arxiv.2306.01567,
  title  = {Segment Anything in High Quality},
  author = {Lei Ke and Mingqiao Ye and Martin Danelljan and Yifan Liu and Yu-Wing Tai and Chi-Keung Tang and Fisher Yu},
  journal= {arXiv preprint arXiv:2306.01567},
  year   = {2023}
}

备注

NeurIPS 2023. We propose HQ-SAM to upgrade SAM for high-quality zero-shot segmentation. Github: https://github.com/SysCV/SAM-HQ