中文

EfficientViT-SAM:无损精度的加速分割一切模型

计算机视觉与模式识别 2024-05-20 v2 人工智能 机器学习

摘要

我们提出了EfficientViT-SAM,一个全新的加速分割一切模型系列。我们保留了SAM轻量级的提示编码器和掩码解码器,同时用EfficientViT替换了重量级的图像编码器。在训练方面,我们首先从SAM-ViT-H图像编码器向EfficientViT进行知识蒸馏。随后,我们在SA-1B数据集上进行端到端训练。得益于EfficientViT的效率和能力,EfficientViT-SAM在A100 GPU上通过TensorRT测量,相比SAM-ViT-H实现了48.9倍的加速,且不牺牲性能。我们的代码和预训练模型已在https://github.com/mit-han-lab/efficientvit发布。

关键词

引用

@article{arxiv.2402.05008,
  title  = {EfficientViT-SAM: Accelerated Segment Anything Model Without Accuracy Loss},
  author = {Zhuoyang Zhang and Han Cai and Song Han},
  journal= {arXiv preprint arXiv:2402.05008},
  year   = {2024}
}

备注

CVPR 2024 Workshop (Efficient Large Vision Models)