中文

跨镜头分割一切:一种方法与基准

计算机视觉与模式识别 2025-11-18 v1

摘要

本文聚焦于多镜头半监督视频物体分割(MVOS),其目标是在包含多个镜头的视频中,分割由初始掩码指示的目标物体。现有的VOS方法主要关注单镜头视频,难以处理镜头间断,从而限制了其现实世界的适用性。我们提出了一种过渡模仿数据增强策略(TMA),该策略利用单镜头数据实现跨镜头泛化,以缓解多镜头标注数据严重稀疏的问题,并提出了跨镜头分割一切(SAAS)模型,该模型能够有效检测和理解镜头过渡。为了支持MVOS的评估和未来研究,我们引入了Cut-VOS,这是一个新的MVOS基准,具有密集的掩码标注、多样的物体类别和高频的镜头过渡。在YouMVOS和Cut-VOS上的大量实验表明,所提出的SAAS通过有效模仿、理解和分割复杂过渡,实现了最先进的性能。代码和数据集已发布于https://henghuiding.com/SAAS/。

关键词

引用

@article{arxiv.2511.13715,
  title  = {Segment Anything Across Shots: A Method and Benchmark},
  author = {Hengrui Hu and Kaining Ying and Henghui Ding},
  journal= {arXiv preprint arXiv:2511.13715},
  year   = {2025}
}

备注

AAAI 2026, Project Page: https://henghuiding.com/SAAS/