稀疏主题模型的最优估计
机器学习
2020-01-23 v1 信息检索
机器学习
摘要
主题模型已成为文本数据降维与探索性分析的常用工具,文本数据由n篇文档中p个词的观测频次组成,存储于一个矩阵中。其主要前提是该数据矩阵的均值可分解为两个非负矩阵的乘积:一个词-主题矩阵和一个主题-文档矩阵。本文研究可能逐元素稀疏的的估计,且主题数未知。在此未被充分探索的背景下,我们推导出此类估计的新极小极大下界,并提出一种计算高效的恢复算法。我们给出了估计量的有限样本上界,并表明其在多种情形下与极小极大下界匹配。我们的估计自适应于的未知稀疏性,且分析对任意有限、、及文档长度均成立。在合成数据与半合成数据上的实证结果表明,所提估计量在非稀疏与稀疏下均是现有最优算法的强劲竞争者,并在许多感兴趣的场景中具有更优性能。
引用
@article{arxiv.2001.07861,
title = {Optimal estimation of sparse topic models},
author = {Xin Bing and Florentina Bunea and Marten Wegkamp},
journal= {arXiv preprint arXiv:2001.07861},
year = {2020}
}