FREE-Edit:基于编辑感知注入的矩形流模型零样本图像驱动视频编辑
计算机视觉与模式识别
2026-03-24 v2
摘要
图像驱动视频编辑旨在将编辑内容从修改后的第一帧传播到剩余帧。现有方法通常使用预训练的图像到视频(I2V)模型将源视频反向转换为噪声,然后利用编辑后的第一帧引导采样过程。通常,维护源视频中运动和布局的流行选择是在重建过程中注入注意力。然而,这种注入常导致结果不令人满意——注入过度会与源视频产生冲突的语义,而注入不足则带来有限的源表示。意识到这一点,我们提出了编辑感知注入方法(Editing-awaRE, REE),以调节每个 token 的注入强度。具体而言,我们首先计算源帧与编辑后第一帧之间的像素差,形成相应的编辑掩码。随后,我们利用光流将第一帧的掩码在整个视频中进行跟踪。然后,根据此生成每个 token 的编辑感知特征注入强度,其中在编辑区域不进行注入。基于 REE 注入,我们进一步提出了一个基于最新涌现的矩形流模型的零样本图像驱动视频编辑框架,称为 FREE-Edit。无需微调或训练,FREE-Edit 在各种图像驱动视频编辑场景中均表现出色,显示其能够产生高质量输出的能力。项目页面:https://free-edit.github.io/page/。
引用
@article{arxiv.2603.01164,
title = {FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing},
author = {Maomao Li and Yunfei Liu and Yu Li},
journal= {arXiv preprint arXiv:2603.01164},
year = {2026}
}
备注
13 pages