N-gram文本表示在伊博语文本文档相似性上的比较分析
计算与语言
2020-08-05 v2
摘要
信息技术的进步促进了伊博语在在线资源与新闻文章等文本创建中的使用。文本相似性在任何基于文本的应用中都至关重要。本文给出了n-gram文本表示在伊博语文本文档相似性上的比较分析。其采用欧氏相似性度量来确定以两种基于词的n-gram文本表示(unigram与bigram)模型表示的伊博语文本文档间的相似性。相似性度量的评估基于所采用的文本表示模型。该模型以面向对象方法设计,并用Python编程语言结合自然语言工具包(NLTK)中的工具实现。结果显示,unigram表示的文本具有最高距离值,而bigram具有相应最低距离值。距离值越低,两文档越相似,且当用于需要相似性度量的任务时模型质量越好。两文档的相似性随距离值向零(0)下降而增加。理想情况下,分析结果表明,基于bigram表示文本度量的伊博语文本文档相似性给出准确的相似性结果。当用于伊博语文本上的文本分类、聚类与排序等任务时,这将给出更好、更有效且准确的结果。
引用
@article{arxiv.2004.00375,
title = {Comparative Analysis of N-gram Text Representation on Igbo Text Document Similarity},
author = {Nkechi Ifeanyi-Reuben and Chidiebere Ugwu and Nwachukwu E. O},
journal= {arXiv preprint arXiv:2004.00375},
year = {2020}
}