中文

RMP-SAM:迈向实时多用途Segment Anything

计算机视觉与模式识别 2025-03-03 v2

摘要

近期采用大规模数据训练和Transformer架构的分割方法,旨在创建一个能够执行多种任务的基础模型。然而,这些方法大多依赖沉重的编码器和解码器框架,阻碍了它们在实时场景中的性能。为了探索实时分割,最近的进展主要集中在特定环境(如自动驾驶)内的语义分割。然而,它们通常忽略了这些模型在不同场景中的泛化能力。因此,为了填补这一空白,本研究探索了一种称为实时多用途分割的新型实时分割设定。它包含三个基础子任务:交互式分割、全景分割和视频实例分割。与以往为每个任务使用特定设计的方法不同,我们旨在仅使用单个端到端模型实时完成所有这些任务。为了满足实时要求并平衡多任务学习,我们提出了一种新颖的基于动态卷积的方法——实时多用途SAM(RMP-SAM)。它包含一个高效的编码器和一个高效的解耦适配器,以执行提示驱动的解码。此外,我们进一步探索了不同的训练策略和一种新的适配器设计,以进一步提升协同训练性能。我们通过扩展现有工作来支持我们的多用途分割,从而对几个强大的基线进行了基准测试。大量实验表明,RMP-SAM是有效的,并在提出的基准和其他特定语义任务上具有良好的泛化能力。我们的RMP-SAM实现在这些任务的准确性和速度之间达到了最佳平衡。我们的代码和模型可在 https://github.com/xushilin1/RAP-SAM/ 获取。

关键词

引用

@article{arxiv.2401.10228,
  title  = {RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything},
  author = {Shilin Xu and Haobo Yuan and Qingyu Shi and Lu Qi and Jingbo Wang and Yibo Yang and Yining Li and Kai Chen and Yunhai Tong and Bernard Ghanem and Xiangtai Li and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2401.10228},
  year   = {2025}
}

备注

ICLR-2025 (oral). Project Page: https://xushilin1.github.io/rap_sam/