中文

RepViT-SAM:迈向实时分割一切

计算机视觉与模式识别 2024-03-01 v2

摘要

Segment Anything Model (SAM) 最近在各种计算机视觉任务中展示了令人印象深刻的零样本迁移性能。然而,其沉重的计算成本对于实际应用来说仍然令人望而生畏。MobileSAM 提出通过采用蒸馏用 TinyViT 替换 SAM 中的重量级图像编码器,这导致计算需求的大幅减少。然而,由于自注意力机制导致的巨大内存和计算开销,其在资源受限的移动设备上的部署仍然面临挑战。最近,RepViT 通过将 ViT 的高效架构设计融入 CNN,在移动设备上实现了 SOTA 的性能和延迟权衡。在这里,为了在移动设备上实现实时分割一切,遵循 MobileSAM,我们用 RepViT 模型替换了 SAM 中的重量级图像编码器,最终形成了 RepViT-SAM 模型。大量实验表明,RepViT-SAM 比 MobileSAM 具有显著更好的零样本迁移能力,以及近 10×10\times 的推理速度。代码和模型可在 \url{https://github.com/THU-MIG/RepViT} 获取。

关键词

引用

@article{arxiv.2312.05760,
  title  = {RepViT-SAM: Towards Real-Time Segmenting Anything},
  author = {Ao Wang and Hui Chen and Zijia Lin and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2312.05760},
  year   = {2024}
}

备注

Technical report of RepViT+SAM in our CVPR 2024 work. Project page: https://jameslahm.github.io/repvit-sam/