中文

基于整流随机微分方程的语义图像反演与编辑

机器学习 2024-10-15 v1 计算机视觉与模式识别 机器学习

摘要

生成模型将随机噪声转换为图像;其反演旨在将图像转换回结构化噪声,以实现恢复与编辑。本文解决两个关键任务:(i) 反演;(ii) 使用随机等价的整流流模型(如 Flux)对真实图像进行编辑。尽管扩散模型(Diffusion Models, DMs)最近在图像生成领域占据主导地位,但其反演因漂移项和扩散项中的非线性,存在忠实度和可编辑性挑战。现有的 SOTA 扩散模型反演方法依赖于额外参数的训练或潜在变量的测试时优化;两者在实际应用中都昂贵。整流流(Rectified Flows, RFs)为扩散模型提供了有前景的替代方案,但其反演研究尚不充分。我们提出基于线性二次型制导器推导的动态最优控制的 RF 反演方法。我们证明,所得向量场等价于整流随机微分方程。此外,我们扩展框架设计用于 Flux 的随机采样器。我们的反演方法实现了零样本反演和编辑的 SOTA 性能,在笔画到图像合成和语义图像编辑中超越了先前方法,大规模人类评估确认用户偏好。

关键词

引用

@article{arxiv.2410.10792,
  title  = {Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations},
  author = {Litu Rout and Yujia Chen and Nataniel Ruiz and Constantine Caramanis and Sanjay Shakkottai and Wen-Sheng Chu},
  journal= {arXiv preprint arXiv:2410.10792},
  year   = {2024}
}

备注

Preprint