中文

扩散模型中低维子空间的探索:用于可控图像编辑的LOCO Edit方法

计算机视觉与模式识别 2026-03-17 v3 机器学习

摘要

最近,扩散模型作为一种强大的生成模型已取得显著成功。尽管如此,对于其语义空间的理解仍有限,这使得在无需额外训练的情况下实现精确且解耦的图像生成(尤其是无监督方式)仍具挑战。本文从有趣的观察出发,改进了对其语义空间的理解:在一定噪声水平范围内,(1)扩散模型中学习的后验均值预测器(PMP)在局部呈线性关系,(2)其雅可比矩阵的奇异向量位于低维语义子空间中。我们提供了严格的理论依据来论证PMP的线性性和低秩性。这些洞察允许我们提出一种无需训练的单步训练-free LOw-rank COntrollable image editing (LOCO Edit) 方法,用于精确的局部图像编辑。LOCO Edit识别的编辑方向具有良好的特性:均匀性、可迁移性、可组合性和线性关系。这些LOCO Edit的特性深受低维语义子空间的支持。我们的方法可进一步扩展为无监督或文本监督的编辑,适用于各种文本到图像扩散模型(T-LOCO Edit)。最后,大量实验结果表明,LOCO Edit在有效性和效率方面均表现出色。

关键词

引用

@article{arxiv.2409.02374,
  title  = {Exploring Low-Dimensional Subspaces in Diffusion Models for Controllable Image Editing},
  author = {Siyi Chen and Huijie Zhang and Minzhe Guo and Yifu Lu and Peng Wang and Qing Qu},
  journal= {arXiv preprint arXiv:2409.02374},
  year   = {2026}
}

备注

NeurIPS 2024