中文

面向稀疏且过度离散离散数据的变分自编码器

机器学习 2019-05-27 v2 机器学习

摘要

许多应用,如文本建模、高通量测序和推荐系统,需要分析稀疏、高维且过度离散的离散(计数值或二值)数据。尽管概率矩阵分解与线性/非线性潜因子模型在对此类数据建模方面取得了巨大成功,许多现有模型由于对计数值数据中过度离散的建模能力不足以及普遍的模型误设,可能具有较差的建模性能。在本文中,我们全面研究这些问题,并提出一种基于变分自编码器的框架,该框架通过负二项分布生成离散数据。我们还检验了模型捕捉离散数据中自激发与互激发等性质的能力,这对建模过度离散至关重要。我们在离散数据分析的三个重要问题上进行了广泛实验:文本分析、协同过滤和多标签学习。与若干 SOTA(state-of-the-art,最先进)基线相比,所提模型在上述问题上取得了显著更优的性能。

关键词

引用

@article{arxiv.1905.00616,
  title  = {Variational Autoencoders for Sparse and Overdispersed Discrete Data},
  author = {He Zhao and Piyush Rai and Lan Du and Wray Buntine and Mingyuan Zhou},
  journal= {arXiv preprint arXiv:1905.00616},
  year   = {2019}
}