通用正态嵌入
计算机视觉与模式识别
2026-03-24 v1 图像与视频处理
摘要
生成模型和视觉编码器在很大程度上沿着不同的轨道发展,针对不同的目标进行优化,并基于不同的数学原理。然而,它们共享一个基本属性:潜在空间高斯性。生成模型将高斯噪声映射到图像,而编码器将图像映射到语义嵌入,其坐标在经验上表现为高斯分布。我们假设两者都是共享潜在源——通用正态嵌入(UNE)的视图:一个近似高斯的潜在空间,编码器嵌入和 DDIM 逆噪声作为其带噪声的线性投影从中产生。为了验证我们的假设,我们引入了 NoiseZoo,这是一个包含每张图像潜在变量的数据集,包括 DDIM 逆扩散噪声和匹配的编码器表示(CLIP、DINO)。在 CelebA 上,两个空间中的线性探针都产生了强且对齐的属性预测,表明生成噪声沿线性方向编码了有意义的语义。这些方向进一步实现了忠实、可控的编辑(例如,微笑、性别、年龄),而无需架构更改,其中简单的正交化减轻了虚假纠缠。综上所述,我们的结果为 UNE 假设提供了实证支持,并揭示了一个共享的类高斯潜在几何结构,具体地将编码和生成联系起来。代码和数据可在 https://rbetser.github.io/UNE/ 获取。
引用
@article{arxiv.2603.21786,
title = {The Universal Normal Embedding},
author = {Chen Tasker and Roy Betser and Eyal Gofer and Meir Yossef Levi and Guy Gilboa},
journal= {arXiv preprint arXiv:2603.21786},
year = {2026}
}
备注
Accepted to CVPR 2026