基于重复运行聚类度量的 LDA 主题稳定性
计算与语言
2018-09-04 v1
摘要
背景:非结构化与文本数据正在快速增长,而潜在狄利克雷分配(LDA)主题建模是其热门的数据分析方法。已有工作表明 LDA 主题的不稳定性可能导致系统性误差。目的:我们提出一种依赖于重复 LDA 运行、聚类并提供主题稳定性度量的方法。方法:我们生成 k 个 LDA 主题并将该过程重复 n 次,得到 n*k 个主题。随后我们使用 K-medoids 将这 n*k 个主题聚为 k 个簇。这 k 个簇现在代表原始 LDA 主题,我们像展示普通 LDA 主题一样展示它们,给出十个最可能词。对于簇,我们尝试多种稳定性度量,并推荐使用排序偏置重叠(Rank-Biased Overlap)来展示簇内主题的稳定性。结果:我们提供了一个初步验证,将该方法用于 270,000 条 Mozilla Firefox 提交信息,取 k=20、n=20。我们展示了主题稳定性度量如何与主题内容相关联。结论:文本挖掘的进展使我们能够分析软件工程中的大量文本,但诸如 LDA 等非确定性算法可能导致不可复现的结论。我们的方法使 LDA 稳定性透明化,并且是对许多关注 LDA 参数调优的已有工作的补充而非替代。
引用
@article{arxiv.1808.08098,
title = {Measuring LDA Topic Stability from Clusters of Replicated Runs},
author = {Mika Mäntylä and Maëlick Claes and Umar Farooq},
journal= {arXiv preprint arXiv:1808.08098},
year = {2018}
}
备注
ESEM '18 ACM / IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM)}{October 11--12, 2018}{Oulu, Finland}