UVOSAM:基于 Segment Anything Model 的无掩码无监督视频对象分割范式
计算机视觉与模式识别
2025-07-09 v3
摘要
当前无监督视频对象分割(UVOS)的最优方法需要在带有掩码标注的视频数据集上进行大量训练,限制了其在复杂场景下的有效性。然而,Segment Anything Model(SAM)引入了基于提示驱动的图像分割新范式,提供了新的可能。本研究通过不同的提示策略探究 SAM 在 UVOS 中的潜力。我们进而提出 UVOSAM,一种利用 STD-Net 跟踪器的无掩码 UVOS 范式。STD-Net 结合了空间-时间解耦可变形注意力机制,以建立帧内与帧间特征之间的有效关联,显著提升了复杂视频场景中框提示的质量。在 DAVIS2017-unsupervised 与 YoutubeVIS19&21 数据集上的大量实验表明,UVOSAM 在无掩码监督下相比现有掩码监督方法具有更优性能,并且具备向弱标注视频数据集泛化的能力。代码见 https://github.com/alibaba/UVOSAM。
引用
@article{arxiv.2305.12659,
title = {UVOSAM: A Mask-free Paradigm for Unsupervised Video Object Segmentation via Segment Anything Model},
author = {Zhenghao Zhang and Shengfan Zhang and Zhichao Wei and Zuozhuo Dai and Siyu Zhu},
journal= {arXiv preprint arXiv:2305.12659},
year = {2025}
}
备注
journal = {Pattern Recognition}