波斯文本流主题检测中频繁模式矢量化与聚类类别的全面研究
计算与语言
2024-03-18 v1
摘要
主题检测是一个复杂的过程,因为它在某种程度上需要分析文本。 对于波斯语的主题检测已有很少的研究,现有算法也不令人瞩目。 因此,我们旨在研究波斯语的主题检测。 本研究的目标是:1) 对最佳主题检测算法进行广泛研究,2) 识别使这些算法适用于波斯语所必需的修改,3) 在波斯社交网络文本上评估它们的性能。 为实现这些目标,我们提出了两个研究问题:首先,鉴于波斯语的研究不足,应对现有框架(尤其是 developed in English 的框架)作出何种修改以使其与波斯语兼容?其二,这些算法的性能如何,哪一个更优秀?存在各种主题检测方法,可分为不同类别。 本研究选取频繁模式和聚类作为研究对象,并提出将两者结合的新类别。随后选取十种方法,这三类方法中的每一种都从零重新实现、修改并适配波斯语。这些十种方法涵盖了不同类型的主题检测方法,在英语中表现良好。用于实验的是波斯社交网络帖子的文本。此外,本文首次在主题检测领域引入一种新的多类别评估标准,称为 FS。实验期间处理了约14亿个标记。结果表明,如果我们正在寻找易于人类理解的关键词主题,则混合类别更好;但如果目标是对帖子进行聚类以进行进一步分析,则频繁模式类别更合适。
引用
@article{arxiv.2403.10237,
title = {A comprehensive study on Frequent Pattern Mining and Clustering categories for topic detection in Persian text stream},
author = {Elnaz Zafarani-Moattar and Mohammad Reza Kangavari and Amir Masoud Rahmani},
journal= {arXiv preprint arXiv:2403.10237},
year = {2024}
}