无模式,无识别:关于文本聚类与主题模型可复现性与失真问题的综述
机器学习
2022-08-04 v1 计算与语言
信息检索
机器学习
摘要
利用机器学习算法从非标注文本中提取知识可能十分复杂。文档分类与信息检索是两种可受益于无监督学习(如文本聚类与主题建模)的应用,包括探索性数据分析。然而,无监督学习范式带来可复现性问题。初始化可能因机器学习算法不同而导致变异性。此外,就聚类几何而言,失真可能产生误导。在诸多原因中,离群点与异常值的存在可能是一个决定性因素。尽管初始化与离群点问题对文本聚类与主题建模十分重要,作者未发现针对它们的深入分析。本综述提供对这些子领域的系统文献回顾(2011-2022),并因相似过程具有不同术语而提出通用术语。作者描述了研究机遇、趋势与开放问题。附录总结了与所回顾工作直接或间接相关的文本向量化、分解及聚类算法的理论背景。
引用
@article{arxiv.2208.01712,
title = {No Pattern, No Recognition: a Survey about Reproducibility and Distortion Issues of Text Clustering and Topic Modeling},
author = {Marília Costa Rosendo Silva and Felipe Alves Siqueira and João Pedro Mantovani Tarrega and João Vitor Pataca Beinotti and Augusto Sousa Nunes and Miguel de Mattos Gardini and Vinícius Adolfo Pereira da Silva and Nádia Félix Felipe da Silva and André Carlos Ponce de Leon Ferreira de Carvalho},
journal= {arXiv preprint arXiv:2208.01712},
year = {2022}
}