SAM-I2V:将 SAM 升级以支持可提示视频分割且训练成本低于 0.2%
计算机视觉与模式识别
2025-06-03 v1
摘要
诸如 Segment Anything Model (SAM) 之类的基础模型显著推进了计算机视觉中的可提示图像分割。然而,将这些能力扩展至视频带来了巨大挑战,特别是在确保动态场景中精确且时间一致的掩码传播方面。SAM 2 试图通过在海量图像和视频数据上从零开始训练模型以学习复杂的时空关联来解决此问题,但这导致了巨大的训练成本,阻碍了研究与实际部署。在本文中,我们引入了 SAM-I2V,一种有效的图像到视频升级方法,用于培育可提示视频分割(PVS)模型。我们的方法策略性地升级预训练的 SAM 以支持 PVS,显著降低了训练复杂度和资源需求。为此,我们引入了三项关键创新: 构建于 SAM 静态图像编码器之上的图像到视频特征提取升级器,以实现时空视频感知; 记忆过滤策略,选择最相关的过去帧以更有效地利用历史信息; 记忆作为提示机制,利用对象记忆确保动态场景中时间一致的掩码传播。综合实验表明,我们的方法在使用仅 0.2% 训练成本的情况下达到了 SAM 2 性能的 90% 以上。我们的工作为 PVS 提供了一条资源高效的途径,降低了 PVS 模型设计进一步研究的门槛,并促进了该领域更广泛的应用与进步。代码和模型可在以下地址获取:https://github.com/showlab/SAM-I2V。
引用
@article{arxiv.2506.01304,
title = {SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost},
author = {Haiyang Mei and Pengyu Zhang and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2506.01304},
year = {2025}
}
备注
CVPR 2025