HDP 与 LDA 模型的统一以优化学科特定题库的主题聚类
信息检索
2020-11-03 v1 计算与语言
机器学习
机器学习
摘要
在高校中,将课程改造为更具互动性且适合在线课程的趋势日益流行。在线课程 popularity 的增加将导致与课程相关的学术查询数量增加。加之若讲座以视频点播形式交付,则没有固定时间供大多数学生提问。讲座中提问时重复出现类似问题的概率可忽略,但异步情况下更有可能。为减少回答每个单独问题所花时间,对问题聚类是理想选择。有不同的无监督模型适用于文本聚类,其中 Latent Dirichlet Allocation 模型最常用。我们使用 Hierarchical Dirichlet Process 来确定 LDA 模型运行的优主题数输入。由于这些主题模型的概率性质,其输出在不同运行中各异。我们发现的总体趋势是:并非所有主题在 LDA 模型首次运行时都被用于聚类,导致聚类效果较差。为应对概率性输出,我们在被使用的有效主题上递归使用 LDA 模型,直至获得效率比为 1。通过实验结果为,我们还建立了关于如何避免 Zeno 悖论的解释。
引用
@article{arxiv.2011.01035,
title = {Unification of HDP and LDA Models for Optimal Topic Clustering of Subject Specific Question Banks},
author = {Nikhil Fernandes and Alexandra Gkolia and Nicolas Pizzo and James Davenport and Akshar Nair},
journal= {arXiv preprint arXiv:2011.01035},
year = {2020}
}
备注
8 pages, 5 figures, Submitted to EAAI21