主题模型中的推断:稀疏性与权衡
机器学习
2015-12-11 v1
摘要
主题模型因对离散数据(例如文本、图像、视频、链接)建模而广受欢迎,并提供了一种在海量数据中发现隐藏结构/语义的高效途径。该领域的核心问题之一是对单个数据实例的后验推断。此问题在流环境中尤为重要,但常常难以处理。在本文中,我们研究了使用 Frank-Wolfe 算法(FW)来恢复后验推断的稀疏解。通过对理论和实际方面的详细阐述,FW 展现出许多有益于主题建模的有趣性质。我们随后利用 FW 设计快速方法,包括 ML-FW,用于大规模学习潜在狄利克雷分配(LDA)。大量实验表明,为达到相同的预测水平,ML-FW 从海量/流数据学习 LDA 可比现有最先进方法快十倍至千倍。
引用
@article{arxiv.1512.03300,
title = {Inference in topic models: sparsity and trade-off},
author = {Khoat Than and Tu Bao Ho},
journal= {arXiv preprint arXiv:1512.03300},
year = {2015}
}