通过 SAM 2 进行视频目标分割:LSVOS 挑战 VOS 赛道的第四个解决方案
计算机视觉与模式识别
2024-08-27 v2
摘要
视频目标分割(VOS)任务旨在仅给定第一帧的物体掩码的情况下,对整个视频序列中的特定物体实例进行分割。最近,Segment Anything Model 2(SAM 2)被提出,这是一个用于解决图像和视频中可提示视觉分割的基础模型。SAM 2 构建了一个数据引擎,通过用户交互改进模型和数据,以收集迄今为止最大的视频分割数据集。SAM 2 是一种简单的 Transformer 架构,具有用于实时视频处理的流式记忆,基于该数据训练后在广泛的任务上提供了强大的性能。在本工作中,我们评估了 SAM 2 在更具挑战性的 VOS 数据集 MOSE 和 LVOS 上的零样本性能。在不微调训练集的情况下,SAM 2 在测试集上取得了 75.79 J&F 的成绩,并在第六届 LSVOS 挑战 VOS 赛道中排名第四。
引用
@article{arxiv.2408.10125,
title = {Video Object Segmentation via SAM 2: The 4th Solution for LSVOS Challenge VOS Track},
author = {Feiyu Pan and Hao Fang and Runmin Cong and Wei Zhang and Xiankai Lu},
journal= {arXiv preprint arXiv:2408.10125},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2408.00714