中文

“看哪,没用手!”一种无参数主题模型

机器学习 2014-09-11 v1 计算与语言 信息检索

摘要

对于统计主题模型的用户而言,预先确定正确的主题数量一直是个负担,而这是大多数主题模型的关键参数。传统上,该参数的自动选择是通过统计模型选择(例如交叉验证、AIC 或 BIC)或贝叶斯非参数模型(例如分层狄利克雷过程)完成的。这些方法要么依赖于重复运行推断算法以搜索大范围的参数值,这不适合大数据挖掘;要么用其他不太直观且仍难以确定的参数替代该参数。在本文中,我们从新角度探索如何“消除”该参数。我们首先提出了一种名为非参数概率潜在语义分析 (nPLSA) 的 PLSA 模型的非参数处理方法。nPLSA 的推断过程允许在单次执行中探索和比较不同数量的主题,同时保持与 PLSA 一样的简单性。这是通过将主题数量参数替换为另一个参数(即文档的最小拟合优度)来实现的。我们表明,可以通过两种无参数处理进一步消除新参数:要么通过监控发现主题之间的多样性,要么通过用户以示例主题形式提供的弱监督。当发现主题之间的多样性最大化时,或者当发现主题的粒度与示例主题匹配时,无参数主题模型会找到合适的主题数量。在合成数据和真实数据上的实验证明,无参数主题模型提取的主题质量与具有“手动变速”的经典主题模型相当。其主题质量优于通过经典贝叶斯非参数模型提取的主题。

关键词

引用

@article{arxiv.1409.2993,
  title  = {"Look Ma, No Hands!" A Parameter-Free Topic Model},
  author = {Jian Tang and Ming Zhang and Qiaozhu Mei},
  journal= {arXiv preprint arXiv:1409.2993},
  year   = {2014}
}