中文

图像与视频中的切片无限模型(SAM 2)

计算机视觉与模式识别 2024-10-29 v2 人工智能 机器学习

摘要

我们提出切片无限模型 2(SAM 2),旨在解决图像和视频中的可提示视觉分割问题。我们构建了一个数据引擎,通过用户交互改进模型与数据,收集了目前为止最大规模的视频分割数据集。该模型采用具有流式记忆的简单变换器架构,实现实时视频处理。SAM 2 在我们的数据集上训练,能在广泛的任务中提供卓越性能。在视频分割方面,我们观察到准确率提升,使用的交互次数比先前方法少 3 倍。在图像分割方面,SAM 2 的准确率更高,速度比切片无限模型(SAM)快 6 倍。我们相信,数据、模型及其洞见将为视频分割及相关感知任务提供重要里程碑。我们将发布主要模型、数据集以及模型训练代码及演示。

关键词

引用

@article{arxiv.2408.00714,
  title  = {SAM 2: Segment Anything in Images and Videos},
  author = {Nikhila Ravi and Valentin Gabeur and Yuan-Ting Hu and Ronghang Hu and Chaitanya Ryali and Tengyu Ma and Haitham Khedr and Roman Rädle and Chloe Rolland and Laura Gustafson and Eric Mintun and Junting Pan and Kalyan Vasudev Alwala and Nicolas Carion and Chao-Yuan Wu and Ross Girshick and Piotr Dollár and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2408.00714},
  year   = {2024}
}

备注

Website: https://ai.meta.com/sam2