中文

生成式 AI 的几何统一:流形概率投影模型

计算机视觉与模式识别 2026-01-16 v2 机器学习

摘要

大多数生成式 AI 模型假设图像本质上是嵌入在高维空间中的低维对象。此外,常隐式假设主题图像数据集形成光滑或分段光滑的流形。常见方法忽略几何结构,仅关注概率方法,通过通用逼近技术(如核方法)来近似概率分布。在某些生成模型中,数据低维本质通过引入较低维潜在空间来体现。然而,潜在空间或流形坐标空间中的概率分布被认为不有趣,被预定义或视为均匀。在本研究中,我们针对盲图像去噪 (Blind Image Denoising, BID) 问题,较大程度上也涉及从噪声生成图像的问题,提出了一种将几何与概率视角统一的方法。我们引入了一种新框架,通过纳入几何假设来改进现有概率方法,有效利用基于核的概率方法。此外,所提出的框架通过引入距离函数,将显式和隐式流形描述结合在一起。产生的框架通过将扩散模型解释为投射到“好图像”流形上的机制,使其解构。这种解释导致构建了新的确定性模型,即流形概率投影模型 (Manifold-Probabilistic Projection Model, MPPM),该模型在表示(像素)空间和潜在空间中 operate。我们演示了 Latent MPPM (LMPPM) 在 various 数据集上的性能优于 Latent Diffusion Model (LDM),在图像修复和生成方面取得优异结果。

关键词

引用

@article{arxiv.2510.00666,
  title  = {A Geometric Unification of Generative AI with Manifold-Probabilistic Projection Models},
  author = {Leah Bar and Liron Mor Yosef and Shai Zucker and Neta Shoham and Inbar Seroussi and Nir Sochen},
  journal= {arXiv preprint arXiv:2510.00666},
  year   = {2026}
}