OmnimatteZero:基于预训练视频扩散模型的无训练 Omnimatte
计算机视觉与模式识别
2025-10-17 v3
摘要
在 Omnimatte 中,旨在将给定视频分解为语义上有意义的图层,包括背景和各个对象及其相关效应(如阴影和反射)。现有方法通常需要大量训练或高昂的自监督优化。本文提出 OmnimatteZero,一种无训练方法,利用即插即用的预训练视频扩散模型实现 Omnimatte。它可以从视频中移除对象,提取单个对象图层及其效应,并将这些对象合成到新的视频中。这些操作通过adapt zero-shot 图像语义填充技术实现,用于视频对象移除,此类任务在即插即用情况下难以有效处理。为克服这一困难,我们引入时空注意力引导模块,以引导扩散过程,实现准确的对象移除和时序一致的背景重建。我们进一步表明,自注意力图捕获了关于对象及其足迹的信息,可用于语义填充对象效应,剩余部分获得干净的背景。此外,通过简单的潜空间算术,可隔离对象图层并与新的视频图层无缝组合,以生成新的视频。评估表明,OmnimatteZero 不仅在背景重建方面实现了优异性能,还创下了最快的 Omnimatte 方法纪录,实现了实时性能,帧处理时间最小。
引用
@article{arxiv.2503.18033,
title = {OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models},
author = {Dvir Samuel and Matan Levy and Nir Darshan and Gal Chechik and Rami Ben-Ari},
journal= {arXiv preprint arXiv:2503.18033},
year = {2025}
}
备注
Accepted to SIGGRAPH ASIA 2025. Project Page: https://dvirsamuel.github.io/omnimattezero.github.io/