MoSAM:具有时空记忆选择的运动引导分割一切模型
计算机视觉与模式识别
2025-05-05 v1 图像与视频处理
摘要
最近的分割一切模型 2(SAM2)在图像和视频的交互式目标分割中展示了卓越的能力。然而,作为一个交互式分割的基础模型,SAM2 直接基于过去六帧的掩码记忆进行分割,这导致了两个重大挑战。首先,在视频推理过程中,由于 SAM2 仅依赖记忆而不考虑目标运动信息,目标可能会消失,这限制了其长程目标跟踪能力。其次,其记忆由固定的过去帧构建,由于记忆中可能存在不准确的分割结果,使其容易受到目标消失或遮挡等挑战的影响。为了解决这些问题,我们提出了 MoSAM,它结合了两个关键策略,将目标运动线索集成到模型中并建立更可靠的特征记忆。首先,我们提出了运动引导提示(MGP),它以稀疏和密集两种方式表示目标运动,然后通过一组运动引导提示将其注入 SAM2。MGP 使模型能够将其焦点调整到运动方向,从而增强目标跟踪能力。此外,考虑到过去的分割结果可能不准确,我们设计了一种时空记忆选择(ST-MS)机制,该机制在像素级和帧级动态识别可能包含准确分割的帧。通过从记忆中消除可能不准确的掩码预测,我们可以利用更可靠的记忆特征来利用相似区域以改善分割结果。在视频目标分割和视频实例分割的各种基准上的大量实验表明,我们的 MoSAM 与其他竞争对手相比取得了最先进的结果。
引用
@article{arxiv.2505.00739,
title = {MoSAM: Motion-Guided Segment Anything Model with Spatial-Temporal Memory Selection},
author = {Qiushi Yang and Yuan Yao and Miaomiao Cui and Liefeng Bo},
journal= {arXiv preprint arXiv:2505.00739},
year = {2025}
}