基于潜在语义分析的阿拉伯语文本摘要以增强阿拉伯语文档聚类
信息检索
2013-02-08 v1 计算与语言
摘要
阿拉伯语文档聚类是一项重要任务,旨在为传统信息检索 (IR) 系统获得良好结果,尤其是在线阿拉伯语文档数量快速增长的背景下。文档聚类旨在利用不同的相似度/距离度量自动将相似文档归入同一簇。该任务常受文档长度影响,文档中的有用信息往往伴随大量噪声,因此有必要在保留有用信息的同时消除噪声,以提升文档聚类性能。本文提出评估利用潜在语义分析 (Latent Semantic Analysis) 模型进行文本摘要对阿拉伯语文档聚类的影响,以解决上述问题;我们使用了五种相似度/距离度量:欧氏距离、余弦相似度、Jaccard 系数、Pearson 相关系数和平均 Kullback-Leibler 散度,并分别在无词干提取和有词干提取两种情况下进行测试。实验结果表明,我们提出的方法有效解决了噪声信息和文档长度问题,从而显著提高了聚类性能。
引用
@article{arxiv.1302.1612,
title = {Arabic text summarization based on latent semantic analysis to enhance arabic documents clustering},
author = {Hanane Froud and Abdelmonaime Lachkar and Said Alaoui Ouatik},
journal= {arXiv preprint arXiv:1302.1612},
year = {2013}
}