中文

通用正态嵌入

计算机视觉与模式识别 2026-03-24 v1 图像与视频处理

摘要

生成模型和视觉编码器在很大程度上沿着不同的轨道发展,针对不同的目标进行优化,并基于不同的数学原理。然而,它们共享一个基本属性:潜在空间高斯性。生成模型将高斯噪声映射到图像,而编码器将图像映射到语义嵌入,其坐标在经验上表现为高斯分布。我们假设两者都是共享潜在源——通用正态嵌入(UNE)的视图:一个近似高斯的潜在空间,编码器嵌入和 DDIM 逆噪声作为其带噪声的线性投影从中产生。为了验证我们的假设,我们引入了 NoiseZoo,这是一个包含每张图像潜在变量的数据集,包括 DDIM 逆扩散噪声和匹配的编码器表示(CLIP、DINO)。在 CelebA 上,两个空间中的线性探针都产生了强且对齐的属性预测,表明生成噪声沿线性方向编码了有意义的语义。这些方向进一步实现了忠实、可控的编辑(例如,微笑、性别、年龄),而无需架构更改,其中简单的正交化减轻了虚假纠缠。综上所述,我们的结果为 UNE 假设提供了实证支持,并揭示了一个共享的类高斯潜在几何结构,具体地将编码和生成联系起来。代码和数据可在 https://rbetser.github.io/UNE/ 获取。

关键词

引用

@article{arxiv.2603.21786,
  title  = {The Universal Normal Embedding},
  author = {Chen Tasker and Roy Betser and Eyal Gofer and Meir Yossef Levi and Guy Gilboa},
  journal= {arXiv preprint arXiv:2603.21786},
  year   = {2026}
}

备注

Accepted to CVPR 2026