中文

基于因子化扩散蒸馏的视频编辑

计算机视觉与模式识别 2024-03-26 v2

摘要

我们介绍了Emu Video Edit (EVE),一种在不依赖任何监督式视频编辑数据的情况下建立视频编辑新状态的模型。为开发EVE,我们分别训练一个图像编辑适配器和一个视频生成适配器,并将两者附加到相同的文本到图像模型上。随后,为了将适配器指向视频编辑,我们引入了一种新的无监督蒸馏程序,即因子化扩散蒸馏。该程序能够无需任何监督数据地同时从一个或多个教师模型蒸馏知识。我们利用该程序教授EVE通过(i)精确编辑来自图像编辑适配器的每个单独帧,以及(ii)使用视频生成适配器确保编辑后帧之间的时间一致性来编辑视频。最后,为了展示我们方法在解锁其他能力方面的潜力,我们将额外的适配器组合Alignments。

关键词

引用

@article{arxiv.2403.09334,
  title  = {Video Editing via Factorized Diffusion Distillation},
  author = {Uriel Singer and Amit Zohar and Yuval Kirstain and Shelly Sheynin and Adam Polyak and Devi Parikh and Yaniv Taigman},
  journal= {arXiv preprint arXiv:2403.09334},
  year   = {2024}
}