分布匹配变分自编码器
计算机视觉与模式识别
2025-12-09 v1
摘要
大多数视觉生成模型在应用扩散或自回归建模之前会将图像压缩到潜空间。然而,现有方法如变分自编码器(VAEs)和面向基础模型对齐的编码器会隐式约束潜空间分布,却未明确塑造其分布,导致难以确定哪些类型的分布对建模最为理想。我们提出了分布匹配变分自编码器(DMVAE),通过分布匹配约束将编码器的潜分布与任意参考分布显式对齐。这超越了常规VAEs的高斯先验,使其能够与来自自监督特征、扩散噪声或其他先验分布派生的分布对齐。通过DMVAE,我们可以系统性地研究哪些潜分布更有利于建模,我们发现基于SSL派生的分布在重建保真度和建模效率之间提供了极佳的平衡,在仅64个训练时代即可实现gFID等于3.2。我们的結果表明,选择合适的潜分布结构(通过分布层面的对齐实现),而非依赖固定先验,正是连接易建模潜变量与高保真图像合成的关键。代码可在 https://github.com/sen-ye/dmvae 获得。
引用
@article{arxiv.2512.07778,
title = {Distribution Matching Variational AutoEncoder},
author = {Sen Ye and Jianning Pei and Mengde Xu and Shuyang Gu and Chunyu Wang and Liwei Wang and Han Hu},
journal= {arXiv preprint arXiv:2512.07778},
year = {2025}
}