监督主题模型的谱学习
机器学习
2016-02-22 v1 计算与语言
信息检索
机器学习
摘要
监督主题模型同时对大规模文档集合的潜在主题结构以及每个文档关联的响应变量进行建模。现有推断方法基于变分近似或蒙特卡洛采样,常受局部极小缺陷困扰。谱方法已被应用于学习无监督主题模型,如隐狄利克雷分配(LDA),并具有可证明的保证。本文研究应用谱方法恢复监督LDA(sLDA)参数的可能性。我们首先提出一种两阶段谱方法,其先恢复LDA参数,随后使用幂更新方法恢复回归模型参数。接着,我们进一步提出一种单阶段谱算法,联合恢复主题分布矩阵以及回归权重。我们的谱算法可证明正确且计算高效。我们证明了每种算法的样本复杂度界,并随后导出sLDA可辨识性的充分条件。在合成和真实世界数据集上的详尽实验验证了理论,并展示了谱算法的实际有效性。事实上,我们在大规模评论评分数据集上的结果表明,仅我们的单阶段谱算法就取得了与最先进的(state-of-the-art)方法相当甚至更好的性能,而先前关于谱方法的工作很少报告如此有前景的性能。
引用
@article{arxiv.1602.06025,
title = {Spectral Learning for Supervised Topic Models},
author = {Yong Ren and Yining Wang and Jun Zhu},
journal= {arXiv preprint arXiv:1602.06025},
year = {2016}
}