伊博语文本文档的分析与表示及其在基于文本系统中的应用
计算与语言
2020-09-15 v1
摘要
信息技术(IT)的发展助力将尼日利亚三大主要语言融入基于文本的应用,如文本挖掘、信息检索与自然语言处理。本文关注伊博语,该语言以复合作为常见的构词类型,并拥有大量复合词词汇。搭配、词序与复合现象在伊博语中起着重要作用。处理这些复合词时的歧义性使得伊博语文本文档的表示十分困难,因为这一问题无法用最常见且标准的词袋(BOW)文本表示模型解决——该模型忽略词序与关系。然而,这引发了关切,并有必要开发改进模型以捕捉此状况。本文在分析伊博语文本文档时考量其复合特性,并描述以基于词的N-gram模型对其进行表示,以为任何基于文本的应用妥善准备数据。结果表明,Bigram与Trigram n-gram文本表示模型提供了更多语义信息,并解决了复合、词序与搭配问题——这些正是伊博语的主要语言特性。其在任何伊博语基于文本系统中使用时 likely 带来更优性能。
引用
@article{arxiv.2009.06376,
title = {Analysis and representation of Igbo text document for a text-based system},
author = {Ifeanyi-Reuben Nkechi J. and Ugwu Chidiebere and Adegbola Tunde},
journal= {arXiv preprint arXiv:2009.06376},
year = {2020}
}