多变量变分自编码器
机器学习
2025-12-02 v2 计算机视觉与模式识别
摘要
学习能够同时具备表达性、几何结构良好且可靠校准的潜在表征,始终是变分自编码器 (VAE) 的核心挑战之一。标准 VAE 通常假设对角高斯后验,这既简化了优化过程,又排除了相关不确定性,往往导致潜在维度被 entangled 或冗余。我们引入多变量变分自编码器 (MVAE),这是一种对 VAE 进行可计算全协方差扩展的方案,通过为编码器增添样本特定的对角尺度和全局耦合矩阵来实现。这是一种形式为 的多变量高斯后验,能够在保持闭式 KL 发散和简单重参数化路径的同时,实现潜在因子之间的相关性。除似然准则外,我们还提出了一套多标准评估协议,联合评估重构质量 (MSE、ELBO)、下游判别能力 (线性探针)、概率校准程度 (NLL、Brier、ECE) 以及无监督结构 (NMI、ARI)。在 Larochelle 风格的 MNIST 变体、Fashion-MNIST 和 CIFAR-10/100 上,MVAE 均能在容量相当的对角协方差 VAE 水平上实现一致的优于或相当于表现,尤其在校准和聚类指标方面在低和高潜在维度上均取得显著提升。定性分析进一步显示,潜在遍历更加平滑、语义更具连贯性,同时重构也更锐利。我们发布了全部代码、数据集划分以及评估工具,以便于可重复比较以及对多变量后验模型的未来扩展。
引用
@article{arxiv.2511.07472,
title = {Multivariate Variational Autoencoder},
author = {Mehmet Can Yavuz},
journal= {arXiv preprint arXiv:2511.07472},
year = {2025}
}