SAM-PD:通过提示去噪,SAM 能在视频跟踪与分割 Anything 中走多远
计算机视觉与模式识别
2024-03-08 v1
摘要
最近,可提示分割模型(如 Segment Anything Model, SAM)在静态图像上展示了强大的零样本泛化能力。这些可提示模型对不精确的提示输入(如不精确的边界框)表现出去噪能力。在本文中,我们探索了将 SAM 应用于视频中物体跟踪和分割的潜力,并将跟踪任务视为提示去噪任务。具体而言,我们迭代地传播前一帧中每个物体掩膜的边界框,作为下一帧的提示。此外,为了增强 SAM 对位置和大小变化的去噪能力,我们提出了一种多提示策略,即为每个物体提供多个经过抖动和缩放的边界框提示,并保留与模板掩膜语义相似度最高的掩膜预测。我们还引入了一种基于点的细化阶段,以处理遮挡并减少累积误差。在不涉及跟踪模块的情况下,我们的方法在 DAVIS2017、YouTubeVOS2018 和 UVO 三个数据集的视频物体/实例分割任务中展示了相当的性能,作为一个简洁的基线,赋予了基于 SAM 的下游应用跟踪能力。
引用
@article{arxiv.2403.04194,
title = {SAM-PD: How Far Can SAM Take Us in Tracking and Segmenting Anything in Videos by Prompt Denoising},
author = {Tao Zhou and Wenhan Luo and Qi Ye and Zhiguo Shi and Jiming Chen},
journal= {arXiv preprint arXiv:2403.04194},
year = {2024}
}