中文

主题模型的自编码变分推断

机器学习 2017-03-07 v1

摘要

主题模型是学习文本表示最流行的方法之一,但一个主要挑战是,对主题模型的任何更改都需要通过数学推导出新的推断算法。解决此问题的一个有前景的方法是自编码变分贝叶斯(AEVB),但实践证明它难以应用于主题模型。我们提出了据我们所知首个有效的基于 AEVB 的潜在狄利克雷分配(LDA)推断方法,我们称之为主题模型自编码变分推断(AVITM)。该模型解决了由狄利克雷先验和分量坍缩给 AEVB 带来的问题。我们发现 AVITM 在准确性上与传统方法相当,但推断时间要快得多。实际上,由于推断网络的存在,我们发现无需在测试数据上运行变分优化即可节省计算成本。因为 AVITM 是黑箱方法,它可以很容易地应用于新的主题模型。作为对此的一个引人注目的例证,我们提出了一个名为 ProdLDA 的新主题模型,它用专家乘积替换了 LDA 中的混合模型。仅通过更改 LDA 的一行代码,我们发现即使 LDA 是通过坍缩吉布斯采样训练的,ProdLDA 也能产生更具可解释性的主题。

关键词

引用

@article{arxiv.1703.01488,
  title  = {Autoencoding Variational Inference For Topic Models},
  author = {Akash Srivastava and Charles Sutton},
  journal= {arXiv preprint arXiv:1703.01488},
  year   = {2017}
}