PropFly:基于预训练视频扩散模型的即时监督学习传播
计算机视觉与模式识别
2026-02-25 v1
摘要
基于传播的视频编辑通过在保持原始上下文(如运动和结构)的同时,将单个编辑帧传播到后续帧,从而实现精确的用户控制。然而,这类模型的训练需要大规模的、成对的(源帧和编辑后帧)视频数据集,而这些数据集成本高昂且获取复杂。因此,我们提出了PropFly,这是一个针对传播式视频编辑的训练管道,依赖于来自预训练视频扩散模型(VDMs)的即时监督,而无需使用现成或预先计算的成对视频编辑数据集。具体而言,我们的PropFly利用具有不同分类器-Free Guidance(CFG)比例的中间噪声潜在变量的单步干净潜在估计,来即时合成“源”潜在(低CFG)和“编辑后”潜在(高CFG)的多样化配对。源潜在提供视频的结构信息,而编辑后潜在提供学习传播的目标变换。我们的管道允许在预训练VDM上附加一个额外的适配器,通过引导调制流匹配(GMFM)损失来学习编辑的传播,该损失指导模型复制目标变换。我们的即时监督确保模型学习时序一致且动态的变换。大量实验表明,我们的PropFly在各种视频编辑任务上显著优于当前最先进的方法,产生高质量的编辑结果。
引用
@article{arxiv.2602.20583,
title = {PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models},
author = {Wonyong Seo and Jaeho Moon and Jaehyup Lee and Soo Ye Kim and Munchurl Kim},
journal= {arXiv preprint arXiv:2602.20583},
year = {2026}
}
备注
The first two authors contributed equally to this work (equal contribution)