评估 SAM2 在视频语义分割中的表现
计算机视觉与模式识别
2026-01-30 v1
摘要
分段感知模型 2 (SAM2) 已被证明是一种强大的可提示式视觉对象分割基础模型,能够在图像和视频中存储对象感知记忆,并通过记忆块在时间上进行迁移。尽管 SAM2 在视频对象分割中通过提供基于提示的稠密分割掩码方面表现出色,但将其扩展到稠密视频语义分割 (VSS) 面临挑战,这需要满足空间精度、时间一致性以及能够跟踪具有复杂边界和不同尺度的多个对象的能力。本文探讨了将 SAM2 扩展用于 VSS,主要关注两种主要方法,并突出在此过程中所面临的首次观察和常见挑战。第一种方法涉及使用 SAM2 从给定图像中提取唯一对象作为掩码,同时在平行中部署分割网络以生成和细化初始预测。第二种方法则利用预测的掩码提取唯一特征向量,然后输入简单的网络进行分类。最终将分类结果和掩码组合以产生最终分割。我们的实验表明,利用 SAM2 可提升 VSS 中的整体性能,主要due于其对对象边界的精确预测。
引用
@article{arxiv.2512.01774,
title = {Evaluating SAM2 for Video Semantic Segmentation},
author = {Syed Hesham Syed Ariff and Yun Liu and Guolei Sun and Jing Yang and Henghui Ding and Xue Geng and Xudong Jiang},
journal= {arXiv preprint arXiv:2512.01774},
year = {2026}
}
备注
17 pages, 3 figures and 7 tables