中文

h-Edit:基于 Doob h-变换的有效且灵活的扩散编辑

计算机视觉与模式识别 2025-03-05 v1

摘要

我们通过将基于扩散的图像编辑表述为逆时桥建模问题,引入了一个理论框架。该方法修改预训练扩散模型的后向过程,以构建一个在时间 0 收敛于与编辑目标相关联的隐式分布的桥。在此框架基础上,我们提出了 h-Edit,一种利用 Doob h-变换和 Langevin Monte Carlo 将中间编辑样本的更新分解为两个组件的新型编辑方法:“重建”项和“编辑”项。这种分解提供了灵活性,允许通过现有的反演技术计算重建项,并能够组合多个编辑项以处理复杂的编辑任务。据我们所知,h-Edit 是第一种能够同时执行文本引导和基于奖励模型编辑的无训练方法。大量定量和定性实验表明,h-Edit 在编辑有效性和忠实度方面优于 SOTA 基线。我们的源代码可在 https://github.com/nktoan/h-edit 获取。

关键词

引用

@article{arxiv.2503.02187,
  title  = {h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-Transform},
  author = {Toan Nguyen and Kien Do and Duc Kieu and Thin Nguyen},
  journal= {arXiv preprint arXiv:2503.02187},
  year   = {2025}
}

备注

Accepted in CVPR 2025