一种用于手写数字图像合成的可解释生成模型
计算机视觉与模式识别
2018-11-13 v1
摘要
本文提出了一种用于手写数字合成的可解释生成模型。现代图像生成模型,如生成对抗网络(GAN)与变分自编码器(VAE),通过反向传播(BP)训练。训练过程复杂且内在机制难以解释。我们提出一种可解释的多阶段 PCA 方法来达成相同目标,并以手写数字图像合成为例进行说明。首先,我们基于各阶段输入的协方差推导基于主成分分析(PCA)的变换核。这产生一系列将相关像素的输入图像转换为不相关分量的谱向量的变换。换言之,这是一个白化过程。然后,我们可通过着色过程基于随机向量与多阶段变换核来合成图像。该生成模型是前馈(FF)设计,因为在模型参数确定中未使用 BP。其设计复杂度显著降低,且整个设计过程可解释。最后,我们使用 MNIST 数据集设计了一个 FF 生成模型,将合成结果与最先进的 GAN 和 VAE 方法所得结果进行比较,并表明所提出的生成模型取得了相当的性能。
引用
@article{arxiv.1811.04507,
title = {An Interpretable Generative Model for Handwritten Digit Image Synthesis},
author = {Yao Zhu and Saksham Suri and Pranav Kulkarni and Yueru Chen and Jiali Duan and C. -C. Jay Kuo},
journal= {arXiv preprint arXiv:1811.04507},
year = {2018}
}