中文

面向生成流形上的编辑:通用扩散图像编辑的理论与实证研究

多媒体 2026-04-01 v1

摘要

扩散式编辑技术近年来快速发展,从精心策划的填充工具发展为覆盖文本指导指令、掩码局部编辑、拖拽几何操作、示例迁移和无训练组合系统等通用编辑器。尽管经验上取得了显著进展,但该领域缺乏统一的处理框架,来界定支配实际可用性的核心需求:可控性(用户能多精确地、连续地指定编辑)、忠实于用户意图(指令语义对齐)、语义一致性(身份和非目标内容保持)、局部性(编辑局限于特定区域)以及感知质量(抑制伪影、保留细节)。本文提供了关于通用扩散图像编辑的理论与实证分析,将多种方法通过将编辑视为引导的学习图像流形上的运输来统一。我们首先将编辑形式化为由条件逆时生成过程诱导的算子,并定义捕获指令遵循、区域保留、语义一致性和重复编辑下的稳定性的任务无关指标。我们随后发展理论,描述以下编辑动力学:(i)噪声注入与去噪运输;(ii)反演-编辑管道及其反演误差的传播;(iii)通过掩码引导或硬约束实现的局部性。 在对学习得分场或流场在轻微 Lipschitz 条件下的假设下,我们推导了将引导强度和反演误差与可测量的非目标区域偏差联系起来的下界,并刻画了在迭代多轮编辑下的累积效应。我们进行了实证基准测试。

关键词

引用

@article{arxiv.2603.29736,
  title  = {Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs},
  author = {Yi Hu and Leying Yi and Emily Davis and Finn Carter},
  journal= {arXiv preprint arXiv:2603.29736},
  year   = {2026}
}

备注

preprint