中文

MPG-SAM 2:使用掩码先验和全局上下文适配 SAM 2用于指涉视频对象分割

计算机视觉与模式识别 2025-08-11 v5

摘要

指涉视频对象分割(RVOS)旨在根据文本描述对视频中的对象进行分割,这需要将多模态信息与时序动态感知相结合。Segment Anything Model 2(SAM 2)在各种视频分割任务中显示出巨大的有效性。然而,其在离线 RVOS 上的应用受到了文本转化为有效提示以及缺乏全局上下文感知能力的挑战。本文提出了一种新颖的 RVOS 框架,称为 MPG-SAM 2,以解决这些挑战。具体而言,MPG-SAM 2 采用统一的多模态编码器对视频和文本特征进行联合编码,生成语义对齐的视频和文本嵌入,以及多模态类别标记。掩码先验生成器利用视频嵌入和类别标记创建目标对象的伪掩码及全局上下文。这些掩码作为稠密提示输入,同时将多模态类别标记作为稀疏提示输入,以生成准确的 SAM 2 提示。为了为在线 SAM 2 提供全局视图,我们引入了层次化的全局-历史聚合器,使 SAM 2 能够在像素级和对象级对目标对象的全局和历史信息进行聚合,从而增强目标表示和时序一致性。在多个 RVOS 数据集上的大量实验表明,MPG-SAM 2 的优势以及我们所提出模块的有效性。代码已公开于 https://github.com/rongfu-dsb/MPG-SAM2。

关键词

引用

@article{arxiv.2501.13667,
  title  = {MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation},
  author = {Fu Rong and Meng Lan and Qian Zhang and Lefei Zhang},
  journal= {arXiv preprint arXiv:2501.13667},
  year   = {2025}
}

备注

ICCV 2025