DragFlow:利用基于区域的监督释放 DiT 先验进行拖拽编辑
计算机视觉与模式识别
2026-03-03 v3 人工智能
机器学习
摘要
基于拖拽的图像编辑长期以来受目标区域失真的困扰,这在很大程度上是因为早期基础模型(Stable Diffusion)的先验不足以将优化后的隐变量投影回自然图像流形。随着从基于 UNet 的 DDPM 转向更具可扩展性的基于流匹配的 DiT(例如 SD3.5、FLUX),生成先验变得显著更强,推动了各种编辑任务的进步。然而,基于拖拽的编辑尚未从这些更强的先验中获益。本工作提出了首个有效利用 FLUX 丰富先验进行拖拽编辑的框架,名为 DragFlow,相较于基线取得了显著提升。我们首先表明,将基于点的拖拽编辑直接应用于 DiT 效果不佳:与 UNet 高度压缩的特征不同,DiT 特征结构化不足,无法为逐点运动监督提供可靠指导。为克服这一局限,DragFlow 引入了基于区域的编辑范式,其中仿射变换实现了更丰富、更一致的特征监督。此外,我们集成了预训练的开放领域个性化适配器(如 IP-Adapter)以增强主体一致性,同时通过基于梯度掩码的硬约束保留背景保真度。我们进一步利用多模态大语言模型(MLLMs)来解决任务歧义。为了进行评估,我们构建了一个新颖的基于区域的拖拽基准,具有区域级拖拽指令。在 DragBench-DR 和 ReD Bench 上的大量实验表明,DragFlow 超越了基于点和基于区域的基线,在基于拖拽的图像编辑中确立了新的最优。代码和数据集可在 https://github.com/Edennnnnnnnnn/DragFlow 获取。
引用
@article{arxiv.2510.02253,
title = {DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing},
author = {Zihan Zhou and Shilin Lu and Shuli Leng and Shaocong Zhang and Zhuming Lian and Xinlei Yu and Adams Wai-Kin Kong},
journal= {arXiv preprint arXiv:2510.02253},
year = {2026}
}
备注
Accepted by ICLR 2026