中文

多变量变分自编码器

机器学习 2025-12-02 v2 计算机视觉与模式识别

摘要

学习能够同时具备表达性、几何结构良好且可靠校准的潜在表征,始终是变分自编码器 (VAE) 的核心挑战之一。标准 VAE 通常假设对角高斯后验,这既简化了优化过程,又排除了相关不确定性,往往导致潜在维度被 entangled 或冗余。我们引入多变量变分自编码器 (MVAE),这是一种对 VAE 进行可计算全协方差扩展的方案,通过为编码器增添样本特定的对角尺度和全局耦合矩阵来实现。这是一种形式为 N(μϕ(x),Cdiag(σϕ2(x))C)N(\mu_\phi(x), C \operatorname{diag}(\sigma_\phi^2(x)) C^\top) 的多变量高斯后验,能够在保持闭式 KL 发散和简单重参数化路径的同时,实现潜在因子之间的相关性。除似然准则外,我们还提出了一套多标准评估协议,联合评估重构质量 (MSE、ELBO)、下游判别能力 (线性探针)、概率校准程度 (NLL、Brier、ECE) 以及无监督结构 (NMI、ARI)。在 Larochelle 风格的 MNIST 变体、Fashion-MNIST 和 CIFAR-10/100 上,MVAE 均能在容量相当的对角协方差 VAE 水平上实现一致的优于或相当于表现,尤其在校准和聚类指标方面在低和高潜在维度上均取得显著提升。定性分析进一步显示,潜在遍历更加平滑、语义更具连贯性,同时重构也更锐利。我们发布了全部代码、数据集划分以及评估工具,以便于可重复比较以及对多变量后验模型的未来扩展。

关键词

引用

@article{arxiv.2511.07472,
  title  = {Multivariate Variational Autoencoder},
  author = {Mehmet Can Yavuz},
  journal= {arXiv preprint arXiv:2511.07472},
  year   = {2025}
}