中文

去噪多 Beta VAE:用于解耦和生成的表示学习

机器学习 2025-07-10 v1 人工智能 计算机视觉与模式识别

摘要

在生成模型中,通常以牺牲生成质量为代价来获得解耦且可解释的潜表征。β\beta-VAE 框架引入超参数 β\beta 以平衡解耦和重构质量,其中设定 β>1\beta > 1 会引入信息瓶颈,优先考虑解耦而非锐利、准确的重构。为解决这一权衡,我们提出一种新型生成建模框架,利用一系列 β\beta 值学习对应的多个潜表征。首先,我们通过训练单个变分自编码器(VAE),并采用新的损失函数控制每个潜表征中保留的信息,以确保更高的 β\beta 值优先考虑解耦而非重构保真度。随后,我们引入一种非线性扩散模型,对不同 β\beta 值对应的潜表征进行平滑过渡。该模型向更少解耦且更具信息性的表征去噪,最终实现几乎无损的表征,从而实现锐利的重构。此外,我们的模型支持无需输入图像即可进行样本生成,作为独立的生成模型运行。我们在解耦和生成质量方面对我们的框架进行评估。此外,我们观察到随着 β\beta 的变化,潜空间中存在平滑的过渡,促进了对生成输出的一致性操控。

关键词

引用

@article{arxiv.2507.06613,
  title  = {Denoising Multi-Beta VAE: Representation Learning for Disentanglement and Generation},
  author = {Anshuk Uppal and Yuhta Takida and Chieh-Hsin Lai and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2507.06613},
  year   = {2025}
}

备注

24 pages, 8 figures and 7 tables