中文

无需训练的视频内容、动作与动态的通用编辑

计算机视觉与模式识别 2026-03-19 v1

摘要

受控视频生成近年来取得了显著进展。然而,编辑动作和动态事件,或插入应影响其他对象在真实视频中行为的内容,仍然是一个主要挑战。现有的训练模型在处理复杂编辑时难以应对,可能是由于收集相关训练数据的困难。同样,现有的无训练方法本质上受限于结构和运动保持编辑,无法支持修改运动或相互作用。我们引入DynaEdit,一种无需训练的编辑方法,利用预训练的文本到视频流模型实现了灵活的视频编辑能力。该方法依赖于最近引入的无 inversion-free 方法,该方法不干预模型内部,因此对模型具有通用性。我们表明, naively 尝试将此方法应用于一般无限制编辑会导致严重的低频错位和高频抖动。我们解释了这些现象的来源,并引入了新的机制来克服它们。通过大量实验,我们表明DynaEdit 在处理复杂基于文本的视频编辑任务方面实现了最先进的效果,包括修改动作、插入与场景互动的对象以及引入全局效果。

关键词

引用

@article{arxiv.2603.17989,
  title  = {Versatile Editing of Video Content, Actions, and Dynamics without Training},
  author = {Vladimir Kulikov and Roni Paiss and Andrey Voynov and Inbar Mosseri and Tali Dekel and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2603.17989},
  year   = {2026}
}

备注

Project page at https://dynaedit.github.io/