通过全依赖混合模型进行主题建模
信息检索
2020-03-03 v3 机器学习
机器学习
摘要
本文中,我们引入一种新颖的主题建模方法,其通过使用数据的紧凑表示并利用 GPU 架构,可扩展到大型数据集。在该方法中,主题直接从语料的共现数据中学习。特别地,我们引入一种新颖的混合模型,称之为全依赖混合(FDM)模型。FDM 在数据的一般生成假设下对二阶矩进行建模。尽管已有利用二阶矩进行主题建模的先前工作,我们开发了用于拟合带有单一 Kullback Leibler 目标的 FDM 的直接随机优化过程。矩方法一般而言具有每次迭代不再需要随语料规模缩放的优点。我们的方法使我们能够针对主题建模问题利用标准优化器与 GPU。特别地,我们在两个大型数据集(NeurIPS 论文与 Twitter 语料)上以大量主题对该方法进行评估,并表明其表现与标准基准相当或更优。
引用
@article{arxiv.1906.06181,
title = {Topic Modeling via Full Dependence Mixtures},
author = {Dan Fisher and Mark Kozdoba and Shie Mannor},
journal= {arXiv preprint arXiv:1906.06181},
year = {2020}
}