中文

LDA 的模型阶数估计保证与样本复杂度界

机器学习 2014-01-23 v4

摘要

如何确定混合模型(如潜在狄利克雷分配 (LDA))中独立潜在因子(主题)的数量是一个极具实际重要性的问题。在大多数应用中,主题的确切数量是未知的,且取决于具体应用和数据集的大小。贝叶斯非参数方法可以避免主题数量选择的问题,但对于大样本量而言可能慢得不切实际,且易陷入局部最优。我们开发了一种保证的主题数量恢复过程,该过程无需预先学习模型的潜在参数。我们的过程依赖于对随机矩阵理论结果的适配。我们的主题数量恢复过程的性能优于非参数方法 hLDA。我们还讨论了我们的结果对 LDA 流行谱学习算法的样本复杂度和准确性的一些启示。我们的结果和过程也可扩展至其他可交换混合模型以及隐马尔可夫模型的谱学习算法。

关键词

引用

@article{arxiv.1312.2646,
  title  = {Guaranteed Model Order Estimation and Sample Complexity Bounds for LDA},
  author = {E. D. Gutiérrez},
  journal= {arXiv preprint arXiv:1312.2646},
  year   = {2014}
}

备注

Preliminary, unsubmitted draft; Incomplete