中文

视频对象分割与跟踪:从过去到未来的全面综述

计算机视觉与模式识别 2025-08-05 v2

摘要

视频对象分割与跟踪(VOST)是计算机视觉中一个复杂而关键的挑战,要求在具有时序动态特性的帧之间实现分割与跟踪的稳健集成。传统方法在域外推理、时序一致性和计算效率方面屈居于下。基于Segment Anything Model(SAM)及其后继版本SAM2等基础模型的出现,引领了一场范式革命,实现了以提示驱动的分割,具备强大的泛化能力。基于这些进展,本综述提供了关于SAM/SAM2用于VOST的方法的全面回顾,沿着三个时序维度进行结构化:过去、当下与未来。我们检查保留和更新历史信息(过去)的策略,探讨从当前帧中提取和优化判别特征的方法(当下),以及预测后续帧中对象动力学的运动预测和轨迹估计算法(未来)。在此过程中,我们概述了从早期基于记忆的架构到SAM2的流式记忆与实时分割能力的演进。我们还讨论了诸如运动感知记忆选择和轨迹导向式提示等最新创新,这些方法旨在提升准确率与效率。最后,我们指出剩余挑战,包括记忆冗余、误差累积和提示效率不足,并提出了面向未来研究的有前景的方向。本综述提供了该领域的及时且结构化的概览,旨在通过基础模型的视角引导研究者和实践者在VOST领域持续推进技术发展。

关键词

引用

@article{arxiv.2507.22792,
  title  = {Segment Anything for Video: A Comprehensive Review of Video Object Segmentation and Tracking from Past to Future},
  author = {Guoping Xu and Jayaram K. Udupa and Yajun Yu and Hua-Chieh Shao and Songlin Zhao and Wei Liu and You Zhang},
  journal= {arXiv preprint arXiv:2507.22792},
  year   = {2025}
}

备注

45 pages, 21 figures