中文

基于标签归纳分组算法的文本挖掘方法

信息检索 2021-12-17 v1 人工智能

摘要

信息检索方法的主要焦点是提供准确、高效且具成本效益的结果。LINGO(标签归纳分组算法)是一种聚类算法,旨在以高质量簇的形式提供搜索结果,但也存在若干局限。本文中,我们的焦点基于取得更有意义的结果并改进算法的整体性能。LINGO工作于两个主要步骤:使用潜在语义索引技术(LSI)的簇标签归纳,以及使用向量空间模型(VSM)的簇内容发现。由于LINGO在簇内容发现中使用VSM,我们的任务是以LSI替换VSM用于簇内容发现,并分析将LSI与Okapi BM25结合使用的可行性。下一任务是将改进方法的结果与LINGO原始方法比较。该研究应用于五个不同的基于文本的数据集,以对每种方法获得更可靠的结果。研究结果显示,当使用LSI进行内容发现时LINGO产生40-50%更好的结果。来自理论证据,在LSI中使用Okapi BM25作为评分方法(LSI+Okapi BM25)用于簇内容发现代替VSM,相较于VSM与LSI的结果,在可扩展性与性能方面也产生更好的簇生成。

关键词

引用

@article{arxiv.2112.08486,
  title  = {Text Mining Through Label Induction Grouping Algorithm Based Method},
  author = {Gulshan Saleem and Nisar Ahmed and Usman Qamar},
  journal= {arXiv preprint arXiv:2112.08486},
  year   = {2021}
}

备注

Presented in 5th International. Multidisciplinary Conference, 29-31 Oct., at, ICBS, Lahore