EfficientSAM:利用掩码图像预训练实现高效的 Segment Anything
计算机视觉与模式识别
2023-12-05 v1
摘要
Segment Anything Model (SAM) 已成为众多视觉应用的强大工具。驱动其令人印象深刻的零样本迁移性能和高通用性的关键组件,是在广泛的高质量 SA-1B 数据集上训练的超大型 Transformer 模型。尽管有益,但 SAM 模型巨大的计算成本限制了其在更广泛实际应用中的部署。为了解决这一局限性,我们提出了 EfficientSAMs,这是一种轻量级 SAM 模型,在大幅降低复杂度的同时展现出不错的性能。我们的想法基于利用掩码图像预训练 SAMI,该方法通过学习从 SAM 图像编码器重建特征来实现有效的视觉表示学习。进一步地,我们采用 SAMI 预训练的轻量级图像编码器和掩码解码器构建 EfficientSAMs,并在 SA-1B 上针对 segment anything 任务进行微调。我们在包括图像分类、目标检测、实例分割和语义目标检测在内的多个视觉任务上进行了评估,发现我们提出的预训练方法 SAMI 始终优于其他掩码图像预训练方法。在诸如零样本实例分割等 segment anything 任务上,采用 SAMI 预训练轻量级图像编码器的 EfficientSAMs 表现优异,与其他快速 SAM 模型相比取得了显著提升(例如,在 COCO/LVIS 上约 4 AP)。
引用
@article{arxiv.2312.00863,
title = {EfficientSAM: Leveraged Masked Image Pretraining for Efficient Segment Anything},
author = {Yunyang Xiong and Bala Varadarajan and Lemeng Wu and Xiaoyu Xiang and Fanyi Xiao and Chenchen Zhu and Xiaoliang Dai and Dilin Wang and Fei Sun and Forrest Iandola and Raghuraman Krishnamoorthi and Vikas Chandra},
journal= {arXiv preprint arXiv:2312.00863},
year = {2023}
}