自回归通用视频分割模型
计算机视觉与模式识别
2025-08-27 v1
摘要
近期的视频基础模型(如 SAM2)通过将掩码视为通用基元,在提示式视频分割方面表现出色。然而,许多现实场景需要无提示分割,即在没有外部线索的情况下检测并跟踪视频中的所有对象,这使得当前领域被特定任务模型和流程所割裂。我们将流式视频分割重新定义为序列掩码预测,类似于语言建模,并提出了自回归通用分割模型(AUSM),这是一种统一了提示式和无提示视频分割的单一架构。AUSM 基于最新的状态空间模型构建,保持固定大小的空间状态,并可扩展到任意长度的视频流。此外,AUSM 的所有组件均设计为跨帧并行训练,相比迭代训练大幅提升了速度。在标准基准测试(DAVIS17、YouTube-VOS 2018 & 2019、MOSE、YouTube-VIS 2019 & 2021 和 OVIS)上,AUSM 优于先前的通用流式视频分割方法,并在 16 帧序列上实现了高达 2.5 倍的训练加速。
引用
@article{arxiv.2508.19242,
title = {Autoregressive Universal Video Segmentation Model},
author = {Miran Heo and Sukjun Hwang and Min-Hung Chen and Yu-Chiang Frank Wang and Albert Gu and Seon Joo Kim and Ryo Hachiuma},
journal= {arXiv preprint arXiv:2508.19242},
year = {2025}
}