VideoMaMa:基于生成式先验的掩码引导视频抠图
计算机视觉与模式识别
2026-01-21 v1 人工智能
摘要
将视频抠图模型推广到实际场景视频仍是一个显著挑战,主要因标注数据稀缺。为此,我们提出了视频掩码到画面的模型(VideoMaMa),通过利用预训练视频扩散模型将粗糙分割掩码转换为像素级精确 alpha 画面。VideoMaMa 在零样本条件下对实际视频具有强大的泛化能力,尽管其仅使用合成数据进行训练。基于这一能力,我们开发了用于大规模视频抠图的可扩展伪标签化管道,并构建了覆盖超过 5 万段多样场景和运动的 Matting Anything in Video(MA-V)数据集,提供高质量的抠图标注。为验证该数据集的有效性,我们在 MA-V 上微调 SAM2 模型获得的 SAM2-Matte 模型,在野外视频的鲁棒性方面优于在现有抠图数据集上训练的同一模型。这些发现凸显了大规模伪标注视频抠图的重要性,并展示了如何通过生成式先验和可获取的分割线索推动视频抠图研究的可扩展进展。
引用
@article{arxiv.2601.14255,
title = {VideoMaMa: Mask-Guided Video Matting via Generative Prior},
author = {Sangbeom Lim and Seoung Wug Oh and Jiahui Huang and Heeji Yoon and Seungryong Kim and Joon-Young Lee},
journal= {arXiv preprint arXiv:2601.14255},
year = {2026}
}
备注
Project page: https://cvlab-kaist.github.io/VideoMaMa/