基于词典与规则的索马里语词形还原方法
计算与语言
2023-08-04 v1
摘要
词形还原是一种自然语言处理(NLP)技术,用于将词的形态派生形式变为其根形式以归一化文本。它用作许多 NLP 任务(包括文本索引、信息检索和面向 NLP 的机器学习等)的核心预处理步骤。本文开创了索马里语文本词形还原的开发,索马里语是一种低资源语言,此前对 NLP 方法和数据集的有效采用非常有限或没有。我们特别为索马里语文本开发了一个基于词典与规则的词形还原器,这是面向各种 NLP 任务的成熟索马里语词形还原系统的起点。考虑到该语言的形态规则,我们构建了包含 1247 个根词和 7173 个派生相关词的初始词典,并辅以对词典外词进行还原的规则。我们在 120 篇不同长度的文档(包括新闻文章、社交媒体帖子和文本消息)上测试了该算法。我们的初步结果表明,该算法在较长文档(如完整新闻文章)上的准确率为 57%,新闻文章摘录为 60.57%,而在社交媒体消息等短文本上准确率高达 95.87%。
引用
@article{arxiv.2308.01785,
title = {Lexicon and Rule-based Word Lemmatization Approach for the Somali Language},
author = {Shafie Abdi Mohamed and Muhidin Abdullahi Mohamed},
journal= {arXiv preprint arXiv:2308.01785},
year = {2023}
}