MobileSAMv2:从分割任意目标到分割一切
摘要
分割任意目标模型(SAM)处理了两个实用且具挑战性的分割任务:\textbf{分割任意目标(SegAny)},利用特定点预测单个感兴趣目标的掩码;以及 \textbf{分割一切(SegEvery)},预测图像上所有目标的掩码。使得 SAM 的 SegAny 速度缓慢的原因是其重量级图像编码器,MobileSAM 已通过解耦知识蒸馏解决了这一问题。然而,SAM 的 SegEvery 效率瓶颈在于其掩码解码器,因为它需要首先使用冗余的网格搜索提示生成大量掩码,然后进行过滤以获得最终的有效掩码。我们提出通过仅使用有效提示直接生成最终掩码来提高其效率,这些有效提示可以通过目标发现获得。我们提出的方法不仅有助于将掩码解码器上的总时间减少至少 16 倍,而且实现了更优的性能。具体而言,在 LVIS 数据集上使用掩码 AR@ 指标进行零样本目标提议时,我们的方法平均性能提升了 3.6\%(42.5\% \textit{v.s.} 38.9\%)。定性结果表明,我们的方法生成了细粒度的掩码,同时避免了对事物的过度分割。这个旨在实现比原始 SAM 更快 SegEvery 的项目被称为 MobileSAMv2,以区别于旨在实现更快 SegAny 的 MobileSAM。此外,我们证明了我们新的提示采样也与 MobileSAM 中蒸馏的图像编码器兼容,从而构成了一个用于高效 SegAny 和 SegEvery 的统一框架。代码可在与 MobileSAM 项目相同的链接处获得:\href{https://github.com/ChaoningZhang/MobileSAM}{\textcolor{red}{https://github.com/ChaoningZhang/MobileSAM}}。
引用
@article{arxiv.2312.09579,
title = {MobileSAMv2: Faster Segment Anything to Everything},
author = {Chaoning Zhang and Dongshen Han and Sheng Zheng and Jinwoo Choi and Tae-Ho Kim and Choong Seon Hong},
journal= {arXiv preprint arXiv:2312.09579},
year = {2023}
}
备注
MobileSAM achieves faster segment anything, while MobileSAMv2 achieves faster segment everything