EfficientViT-SAM:无损精度的加速分割一切模型
计算机视觉与模式识别
2024-05-20 v2 人工智能
机器学习
摘要
我们提出了EfficientViT-SAM,一个全新的加速分割一切模型系列。我们保留了SAM轻量级的提示编码器和掩码解码器,同时用EfficientViT替换了重量级的图像编码器。在训练方面,我们首先从SAM-ViT-H图像编码器向EfficientViT进行知识蒸馏。随后,我们在SA-1B数据集上进行端到端训练。得益于EfficientViT的效率和能力,EfficientViT-SAM在A100 GPU上通过TensorRT测量,相比SAM-ViT-H实现了48.9倍的加速,且不牺牲性能。我们的代码和预训练模型已在https://github.com/mit-han-lab/efficientvit发布。
引用
@article{arxiv.2402.05008,
title = {EfficientViT-SAM: Accelerated Segment Anything Model Without Accuracy Loss},
author = {Zhuoyang Zhang and Han Cai and Song Han},
journal= {arXiv preprint arXiv:2402.05008},
year = {2024}
}
备注
CVPR 2024 Workshop (Efficient Large Vision Models)