中文

肯尼亚自然语言处理现状:一项调查

计算与语言 2024-10-15 v1 人工智能

摘要

肯尼亚以其语言多样性著称,在推进自然语言处理(NLP)技术方面面临独特的挑战和机遇,尤其是在其代表性不足的本土语言方面。本调查评估了肯尼亚NLP的当前状态,重点关注在数据集创建、机器翻译、情感分析以及针对斯瓦希里语、德霍洛语、基库尤语和卢希亚语等当地方言的语音识别方面的持续努力。尽管取得了这些进展,肯尼亚NLP的发展仍受到资源匮乏的限制,导致大多数本土语言在数字空间中的代表性不足。本文通过批判性评估现有数据集和NLP模型,揭示了重大差距,特别是缺乏大规模语言模型以及本土语言数字化表现不足的问题。我们还分析了关键的NLP应用:机器翻译、信息检索和情感分析,考察它们如何针对本地语言需求进行定制。此外,本文探讨了塑造肯尼亚人工智能和NLP未来的治理、政策和法规,并提出了一份战略路线图以指导未来的研发工作。我们的目标是为推动满足肯尼亚多样化语言需求的NLP技术发展奠定基础。

关键词

引用

@article{arxiv.2410.09948,
  title  = {State of NLP in Kenya: A Survey},
  author = {Cynthia Jayne Amol and Everlyn Asiko Chimoto and Rose Delilah Gesicho and Antony M. Gitau and Naome A. Etori and Caringtone Kinyanjui and Steven Ndung'u and Lawrence Moruye and Samson Otieno Ooko and Kavengi Kitonga and Brian Muhia and Catherine Gitau and Antony Ndolo and Lilian D. A. Wanzare and Albert Njoroge Kahira and Ronald Tombe},
  journal= {arXiv preprint arXiv:2410.09948},
  year   = {2024}
}

备注

21 pages