中文

基于语料库的伊博语变音符号恢复方法

计算与语言 2026-01-27 v1 计算机与社会 信息检索

摘要

通过自然语言处理(NLP),研究人员旨在使计算机能够识别并理解人类语言中的模式。这通常很困难,因为语言在其句法、语用和音系中嵌入了许多动态且多变的属性,这些属性需要被捕获和处理。由于 NLP 研究人员不断突破边界,计算机处理自然语言的能力正在提升。但这些研究工作更多集中在英语、日语、德语、法语、俄语、普通话等资源丰富的语言上。世界上 7000 多种语言中有超过 95% 在 NLP 领域属于低资源语言,即它们几乎没有或完全没有用于 NLP 工作的数据、工具和技术。在本文中,我们概述了变音符号歧义问题,并回顾了以往在其他语言上的变音符号消歧方法。聚焦于伊博语,我们报告了为开发用于变音符号恢复的灵活框架而采取的步骤。提出了三种主要方法:标准 n-gram 模型、分类模型和嵌入模型。标准 n-gram 模型使用目标剥离词之前的词序列作为正确变体的关键预测因子。对于分类模型,使用了目标剥离词两侧的词窗口。嵌入模型则比较组合上下文词嵌入与每个候选变体向量的嵌入之间的相似度得分。

关键词

引用

@article{arxiv.2601.18380,
  title  = {Corpus-Based Approaches to Igbo Diacritic Restoration},
  author = {Ignatius Ezeani},
  journal= {arXiv preprint arXiv:2601.18380},
  year   = {2026}
}

备注

270 page. Ph.D. Thesis. The University of Sheffield