中文

将对应关系视为视频:SAM2 上测试时适应的参考分割野外应用

计算机视觉与模式识别 2025-08-12 v1

摘要

大型视觉模型如 Segment Anything Model (SAM) 在野外任务中表现出显著局限性。因此,利用参考图像及其对应掩码为模型提供新知识的参考分割方法日益成为适应视觉模型的有前景方向。然而,现有参考分割方法主要依赖元学习,仍需大量元训练过程,带来巨大的计算成本。本研究提出一种新方法,将参考-目标图像对之间的内在对应关系表示为伪视频。这种视角允许最新版本的 SAM(即 SAM2),其配备交互式视频对象分割(iVOS)能力,在轻量级方式下适应野外任务。我们称该方法为 SAM 的对应关系即视频(CAV-SAM)。CAV-SAM 包含两个关键模块:扩散基准语义转换(DBST)模块采用扩散模型构建语义转换序列;测试时几何对齐(TTGA)模块通过测试时微调对该序列中的几何变化进行对齐。在广泛使用的数据集上评估了 CAV-SAM,分割性能优于 SOTA 方法超过 5%。实现细节见补充材料。

关键词

引用

@article{arxiv.2508.07759,
  title  = {Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild},
  author = {Haoran Wang and Zekun Li and Jian Zhang and Lei Qi and Yinghuan Shi},
  journal= {arXiv preprint arXiv:2508.07759},
  year   = {2025}
}