中文

解纠缠变分自编码器

机器学习 2022-11-16 v1 计算机视觉与模式识别

摘要

变分自编码器(VAE)是一种用于后验推断的概率机器学习框架,它将一组输入的高维数据投影到较低维的潜空间。利用VAE学到的潜空间为创意学科中开发新的数据驱动设计流程提供了令人兴奋的机遇,特别是可自动生成多个在美学上令人联想到输入数据、但在训练时未见过的新设计。然而,学到的潜空间通常是无序且纠缠的:沿单一维度遍历潜空间并不会导致数据单一视觉属性的变化。潜结构缺失阻碍了设计者有意控制从潜空间生成的新设计的视觉属性。本文提出一项探究潜空间解纠缠的实验研究。我们实现了文献中的三种不同VAE模型,并在公开可用的60,000张手写数字图像数据集上训练。我们进行敏感性分析,以找出最大化数据对数边际似然下界所需的少量潜维度。此外,我们探究了解码图像重建质量与潜空间解纠缠程度之间的权衡。我们能够将三个潜维度自动与数字的三个可解释视觉属性对齐:线宽、倾斜与宽度。实验表明:i) 增大潜变量先验与变分分布间Kullback-Leibler散度对证据下界的贡献,以及 ii) 对输入图像类别进行条件化,可增强VAE对解纠缠潜空间的学习。

关键词

引用

@article{arxiv.2211.07700,
  title  = {Disentangling Variational Autoencoders},
  author = {Rafael Pastrana},
  journal= {arXiv preprint arXiv:2211.07700},
  year   = {2022}
}