生成式视频抠图
计算机视觉与模式识别
2025-08-12 v1
摘要
视频抠图传统上受限于缺乏高质量的真实数据。大多数现有视频抠图数据集仅提供人工标注的不完美 alpha 和前景标注,这些标注在训练阶段必须合成到背景图像或视频上。因此,先前方法在真实世界场景中的泛化能力通常较差。在这项工作中,我们提出从两个角度解决这个问题。首先,我们通过追求多样化的合成和伪标注分割数据集,强调大规模预训练的重要性。我们还开发了一个可扩展的合成数据生成流程,能够渲染多样化的人体和精细发丝,产生约 200 个时长为 3 秒的视频片段用于微调。其次,我们引入了一种新颖的视频抠图方法,能够有效利用预训练视频扩散模型中的丰富先验。该架构提供了两个关键优势。第一,强大的先验在弥合合成场景与真实世界场景之间的领域差距方面起着关键作用。第二,与大多数逐帧处理视频抠图并使用独立解码器聚合时序信息的现有方法不同,我们的模型本质上是为视频设计的,确保了强大的时序一致性。我们在三个基准数据集上提供了全面的定量评估,证明了我们方法的卓越性能,并在多样化的真实世界场景中展示了全面的定性结果,说明了我们方法强大的泛化能力。代码可在 https://github.com/aim-uofa/GVM 获取。
引用
@article{arxiv.2508.07905,
title = {Generative Video Matting},
author = {Yongtao Ge and Kangyang Xie and Guangkai Xu and Mingyu Liu and Li Ke and Longtao Huang and Hui Xue and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2508.07905},
year = {2025}
}