中文

DNAEdit:用于文本引导整流流编辑的直接噪声对齐

计算机视觉与模式识别 2025-06-03 v1

摘要

利用大规模预训练文本到图像模型的强大生成能力,免训练方法已展示了令人印象深刻的图像编辑结果。传统基于扩散的方法以及近期基于整流流 (RF) 的方法,通常通过逐渐向干净图像添加噪声来逆转合成轨迹,在此过程中,当前时间步的含噪潜变量被用于近似下一时间步的含噪潜变量,从而引入累积漂移并降低重建精度。考虑到在 RF 中含噪潜变量是通过在每个时间步对高斯噪声和干净图像进行直接插值来估计的,我们提出了直接噪声对齐 (DNA),该方法在噪声域中直接精炼所需的高斯噪声,显著减少了先前方法中的误差累积。具体而言,DNA 估计每个时间步插值含噪潜变量的速度场,并通过计算预测速度场与预期速度场之间的差异来调整高斯噪声。我们验证了 DNA 的有效性,并揭示了其与现有基于 RF 的反演方法之间的关系。此外,我们引入了移动速度引导 (MVG) 来控制目标提示引导的生成过程,平衡图像背景保留与目标对象可编辑性。DNA 和 MVG 共同构成了我们提出的方法,即 DNAEdit。最后,我们引入了 DNA-Bench,一个长提示基准,用于评估先进图像编辑模型的性能。实验结果表明,我们的 DNAEdit 取得了优于 SOTA 文本引导编辑方法的性能。代码和基准将发布于 \href{ https://xiechenxi99.github.io/DNAEdit/}{https://xiechenxi99.github.io/DNAEdit/}。

关键词

引用

@article{arxiv.2506.01430,
  title  = {DNAEdit: Direct Noise Alignment for Text-Guided Rectified Flow Editing},
  author = {Chenxi Xie and Minghan Li and Shuai Li and Yuhui Wu and Qiaosi Yi and Lei Zhang},
  journal= {arXiv preprint arXiv:2506.01430},
  year   = {2025}
}

备注

Project URL: https://xiechenxi99.github.io/DNAEdit