用于学习可解释全局表示的有监督向量量化变分自编码器
机器学习
2019-10-01 v2 机器学习
摘要
学习数据的可解释表示仍是深度学习中的核心挑战。在训练深度生成模型时,观测数据常带有某些类别标签,并且在学习重建数据与生成新数据的同时,学习每类数据的可解释表示也是一个获取知识的过程。在此,我们提出一种称为有监督向量量化变分自编码器(S-VQ-VAE, Supervised Vector Quantized Variational AutoEncoder)的新型生成模型,它结合有监督与无监督学习的优势,为每类数据获得独特且可解释的全局表示。与常规生成模型相比,我们的模型有三个关键优势:第一,它是一个集成模型,可同时学习单个数据点的特征表示和每类数据的全局表示;第二,利用嵌入码学习全局表示受监督信息引导,明确定义了每个码的解释;第三,全局表示捕捉了不同类别的关键特征,揭示了不同数据组底层统计结构的相似性与差异。我们在机器学习基准数据集 MNIST 和来自基于网络的细胞信号整合库(LINCS, Library of Integrated Network-Based Cellular Signatures)的基因表达数据上评估了 S-VQ-VAE 的效用。我们证明 S-VQ-VAE 能够学习受同一类扰动物(PCL, perturbagen class)扰动的样本的全局基因特征,并进一步揭示了 PCL 之间的机制关联。此类知识对促进癌症等复杂疾病的新药开发至关重要。
引用
@article{arxiv.1909.11124,
title = {Supervised Vector Quantized Variational Autoencoder for Learning Interpretable Global Representations},
author = {Yifan Xue and Michael Ding and Xinghua Lu},
journal= {arXiv preprint arXiv:1909.11124},
year = {2019}
}