中文

基于百科知识与神经词嵌入的阿姆哈拉语文本聚类

计算与语言 2022-09-23 v2 机器学习

摘要

在数字时代,几乎每个学科的人们都在使用自动化系统,这些系统以不同自然语言的文档格式生成信息。因此,人们对寻找、组织和分析这些文档的更好解决方案兴趣日增。本文提出一种利用百科知识(EK)与神经词嵌入对阿姆哈拉语文本文档进行聚类的系统。EK 能够表示相关概念,神经词嵌入使我们能够处理相关性的上下文。在聚类过程中,所有文本文档均经过预处理阶段。通过将每个文档与 EK 及词嵌入模型映射,提取丰富的文本文档特征。生成了丰富特征的 TF-IDF 加权向量。最后,使用流行的球形 K-means 算法对文本文档进行聚类。所提系统使用阿姆哈拉语文本语料库与阿姆哈拉语维基百科数据进行测试。测试结果表明,相较于仅使用 EK,将 EK 与词嵌入结合用于文档聚类提高了平均准确率。此外,类别大小的变化对准确率有显著影响。

关键词

引用

@article{arxiv.2105.00809,
  title  = {Amharic Text Clustering Using Encyclopedic Knowledge with Neural Word Embedding},
  author = {Dessalew Yohannes and Yeregal Assabie},
  journal= {arXiv preprint arXiv:2105.00809},
  year   = {2022}
}

备注

problems that were introduced to the manuscript