基于高效簇索引与动态相似度阈值的短文本流快速聚类
信息检索
2021-01-22 v1
摘要
短文本流聚类是一项重要但具有挑战性的任务,因为来自微博、问答以及社交新闻聚合网站等不同来源的大量文本不断生成。对此类海量文本进行聚类的主要挑战之一是在合理的时间内完成聚类。现有的最先进短文本流聚类方法无法在合理时间内聚类如此大量的文本,因为它们计算一条文本与所有已有簇之间的相似度以将该文本分配给某个簇。为克服这一挑战,我们提出了一种快速短文本流聚类方法(称为 FastStream),该方法利用倒排索引高效索引簇,并在将文本分配给簇时仅计算该文本与选定数量簇之间的相似度。通过这种方式,我们不仅降低了所提方法的运行时间,也降低了若干最先进短文本流聚类方法的运行时间。FastStream 基于统计度量动态计算相似度阈值,将文本分配给一个新簇或已有簇。因此,我们的方法有效应对了概念漂移问题。实验结果表明,在多个短文本数据集上,FastStream 以显著优势优于最先进的短文本流聚类方法。此外,FastStream 的运行时间比最先进方法快数个数量级。
引用
@article{arxiv.2101.08595,
title = {Fast Clustering of Short Text Streams Using Efficient Cluster Indexing and Dynamic Similarity Thresholds},
author = {Md Rashadul Hasan Rakib and Muhammad Asaduzzaman},
journal= {arXiv preprint arXiv:2101.08595},
year = {2021}
}
备注
6