EasyOmnimatte:驯服预训练修复扩散模型以实现端到端视频分层分解
计算机视觉与模式识别
2025-12-29 v1
摘要
现有的视频 omnimatte 方法通常依赖于缓慢、多阶段或推理时优化的流程,无法充分利用强大的生成先验,导致分解效果欠佳。我们的核心洞察是,如果视频修复模型能够被微调以去除与前景相关的效应,那么它必然具备感知这些效应的固有能力,因此也可以被微调用于互补任务:带有相关效应的前景层分解。然而,尽管将 LoRA 应用于所有模块对修复模型进行朴素微调可以产生高质量的 alpha matte,但它无法捕获相关效应。我们的系统分析表明,这是因为与效应相关的线索主要编码在特定的 DiT 模块中,当对所有模块应用 LoRA 时它们会被抑制。为了解决这一问题,我们提出了 EasyOmnimatte,这是首个统一的、端到端的视频 omnimatte 方法。具体而言,我们微调一个预训练的视频修复扩散模型以学习双重互补专家,同时保持其原始权重不变:Effect Expert 仅对效应敏感的 DiT 模块应用 LoRA,以捕获前景和相关效应的粗略结构;而完全使用 LoRA 微调的 Quality Expert 则学习精修 alpha matte。在采样过程中,Effect Expert 用于早期高噪声步骤的去噪,而 Quality Expert 在后期低噪声步骤接管。这种设计消除了两次完整扩散过程的需求,在不牺牲输出质量的情况下显著降低了计算成本。消融实验验证了这种双专家策略的有效性。实验表明,EasyOmnimatte 为视频 omnimatte 创立了新的 SOTA,并支持各种下游任务,在质量和效率上均显著优于基线方法。
引用
@article{arxiv.2512.21865,
title = {EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition},
author = {Yihan Hu and Xuelin Chen and Xiaodong Cun},
journal= {arXiv preprint arXiv:2512.21865},
year = {2025}
}