中文

基于N-gram模型的库尔德语索拉尼与库尔曼吉方言下一词预测

计算与语言 2020-08-05 v1

摘要

下一词预测是一种输入技术,通过向用户建议下一个词以供选择来简化打字过程,因为对话中的打字耗费时间。少数先前的研究关注库尔德语,包括下一词预测的使用。然而,库尔德语文本语料库的缺乏带来了挑战。此外,库尔德语缺乏足够数量的N-gram(例如五元语法)是库尔德语下一词预测很少被使用的原因。 furthermore,Rstudio软件中若干库尔德字母显示不当是另一个问题。本文提供了一个库尔德语语料库,创建了五元语法,并提出了针对库尔德语索拉尼和库尔曼吉方言下一词预测的独特研究工作。N-gram模型已被用于下一词预测,以减少库尔德语打字所需的时间。此外,关于库尔德语下一词预测的工作很少;因此,利用N-gram模型来准确地建议文本。为此,使用R编程和RStudio来构建应用程序。该模型的准确率为96.3%。

关键词

引用

@article{arxiv.2008.01546,
  title  = {Next word prediction based on the N-gram model for Kurdish Sorani and Kurmanji},
  author = {Hozan K. Hamarashid and Soran A. Saeed and Tarik A. Rashid},
  journal= {arXiv preprint arXiv:2008.01546},
  year   = {2020}
}

备注

37 pages