中文

FlowDirector:用于精确文本到视频编辑的无训练流导向

计算机视觉与模式识别 2025-12-15 v2

摘要

文本驱动的视频编辑旨在根据自然语言指令修改视频内容。虽然最近的无训练方法利用预训练扩散模型,但它们通常依赖 inversion-editing 框架。该框架在编辑之前将视频映射到潜在空间。然而,inversion process 并不总是准确,常常损害外观保真度和运动一致性。为此,我们引入了 FlowDirector,一种新型无训练且无 inversion 的视频编辑框架。我们的框架将编辑过程建模为数据空间中的直接演化。它利用普通微分方程 (ODE) 指导视频沿其固有的时空流形平滑过渡,从而避免不准确的 inversion 步骤。基于此,我们引入了三种流校正策略,用于改善外观、运动和稳定性:1) 方向感知流校正放大与源方向相互作用的分量并删除无关项,打破保守的流线,使更强的结构和纹理变化成为可能。2) 运动-外观解耦优化运动一致性作为每个时间步的能量项,显著提高了一致性和运动传递。3) 差分平均引导策略利用多个候选流之间的差异以低成本近似低方差 regime,从而抑制伪影并稳定轨迹。广泛的实验在各种编辑任务和基准测试上表明,FlowDirector 在指令遵循、时序一致性和背景保留方面实现了与当前最先进方法的卓越性能,为无 inversion 的连贯视频编辑开辟了一条高效的新范式。

关键词

引用

@article{arxiv.2506.05046,
  title  = {FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing},
  author = {Guangzhao Li and Yanming Yang and Chenxi Song and Chi Zhang},
  journal= {arXiv preprint arXiv:2506.05046},
  year   = {2025}
}

备注

Project Page is https://flowdirector-edit.github.io