中文

VeloEdit:基于速度场分解的无训练一致连续指令式图像编辑

计算机视觉与模式识别 2026-03-17 v1

摘要

指令式图像编辑旨在根据文本指令修改源内容。然是,基于流匹配的现有方法常因去噪引起的重构误差导致保留区域不一致,且缺乏对编辑强度的细粒度控制。为此,我们提出VeloEdit,一种无训练方法,实现高度一致且可连续控制的编辑。VeloEdit通过量化负责保留源内容的速度场与驱动所需编辑的速度场之间的差异,动态识别编辑区域。基于此划分,我们用源恢复速度代替编辑速度以保证保留区域的一致性,通过速度插值实现对编辑强度的连续调制。不同于依赖复杂注意力操作或辅助可训练模块的 prior 工作,VeloEdit 直接作用于速度场。在Flux.1 Kontext和Qwen-Image-Edit上进行的大量实验表明,VeloEdit在视觉一致性和编辑连续性方面取得显著提升,且额外计算开销可忽略不计。代码已公开于https://github.com/xmulzq/VeloEdit。

关键词

引用

@article{arxiv.2603.13388,
  title  = {VeloEdit: Training-Free Consistent and Continuous Instruction-Based Image Editing via Velocity Field Decomposition},
  author = {Zongqing Li and Zhihui Liu and Yujie Xie and Shansiyuan Wu and Hongshen Lv and Songzhi Su},
  journal= {arXiv preprint arXiv:2603.13388},
  year   = {2026}
}

备注

26 pages, 21 figures