中文

稀疏主题模型的最优估计

机器学习 2020-01-23 v1 信息检索 机器学习

摘要

主题模型已成为文本数据降维与探索性分析的常用工具,文本数据由n篇文档中p个词的观测频次组成,存储于一个p×np\times n矩阵中。其主要前提是该数据矩阵的均值可分解为两个非负矩阵的乘积:一个p×Kp\times K词-主题矩阵AA和一个K×nK\times n主题-文档矩阵WW。本文研究可能逐元素稀疏的AA的估计,且主题数KK未知。在此未被充分探索的背景下,我们推导出此类AA估计的新极小极大下界,并提出一种计算高效的恢复算法。我们给出了估计量的有限样本上界,并表明其在多种情形下与极小极大下界匹配。我们的估计自适应于AA的未知稀疏性,且分析对任意有限nnppKK及文档长度均成立。在合成数据与半合成数据上的实证结果表明,所提估计量在非稀疏AA与稀疏AA下均是现有最优算法的强劲竞争者,并在许多感兴趣的场景中具有更优性能。

关键词

引用

@article{arxiv.2001.07861,
  title  = {Optimal estimation of sparse topic models},
  author = {Xin Bing and Florentina Bunea and Marten Wegkamp},
  journal= {arXiv preprint arXiv:2001.07861},
  year   = {2020}
}