视频分割万象论:系统性综述
计算机视觉与模式识别
2024-08-19 v1 人工智能
摘要
近期的基础模型浪潮在计算机视觉及更广泛领域取得了巨大成功,分割万象模型(SAM)引发了对任务无关视觉基础模型的热情。凭借其卓越的零样例泛化能力,SAM 正在挑战诸多传统计算机视觉范式,不仅在各种图像分割和多模态分割(如文本到掩码)任务中表现出色,还在视频领域展现出惊人的性能。此外,最新发布的 SAM 2 再次点燃了在图像和视频上可提示视觉分割的研究热情。然而,现有综述主要聚焦于 SAM 在图像处理任务中的应用,对视频领域的全面深入综述却明显缺失。为填补这一空白,本文在基础模型时代对 SAM 的视频应用进行系统性综述。作为首次综述 SAM 在视频方面的进展,本文聚焦于其在各种任务中的应用,讨论其近期进展及开发基础模型于广泛应用的创新机遇。我们首先简要介绍 SAM 和视频相关研究领域的背景。随后,本文提出系统性分类法,将现有方法归入三个关键领域:视频理解、视频生成和视频编辑,分析总结其优势与局限。此外,提供基于 SAM 的方法与当前最先进方法在代表性基准上的比较结果及深入分析。最后,讨论当前研究面临的挑战,并展望 SAM 视频及更广领域的未来研究方向。
引用
@article{arxiv.2408.08315,
title = {Segment Anything for Videos: A Systematic Survey},
author = {Chunhui Zhang and Yawen Cui and Weilin Lin and Guanjie Huang and Yan Rong and Li Liu and Shiguang Shan},
journal= {arXiv preprint arXiv:2408.08315},
year = {2024}
}
备注
https://github.com/983632847/SAM-for-Videos