中文

语义粒度导航在图像编辑中的应用

计算机视觉与模式识别 2026-05-26 v2

摘要

尽管扩散模型和流模型在生成能力方面取得了显著进展,实图像编辑仍然面临语义可编辑性与结构保真性之间的持续权衡。我们追溯到这一局限性的根本原因在于现有方法范式中,编辑进度与模型规模存在隐式耦合。在这种耦合下,较强的编辑通常需要访问更嘈杂的状态,这会在语义变化被良好局部化之前,耗费计算资源来扰乱布局。我们引入了 NaviEdit,这是一个训练自由的推理时控制器,通过严格的自我一致性协议将编辑进度与模型规模遍历解耦。NaviEdit 在 rollout 级别运行,且无需修改底层预训练模型。它将规模视为控制输入,将固定的步骤预算重新分配给对语义更敏感的中间规模,而不是消耗性的高噪声区域。实验表明,在兼容的编辑器和流模型 Backbone 之间,本方法实现了正向平均提升,支持将解耦作为一种可移植的推理时控制原则。

关键词

引用

@article{arxiv.2605.21190,
  title  = {Semantic Granularity Navigation in Image Editing},
  author = {Liangsi Lu and Minzhe Guo and Xuhang Chen and Yang Shi},
  journal= {arXiv preprint arXiv:2605.21190},
  year   = {2026}
}

备注

Accepted by ICML 2026