中文

巴萨语的音调预测与正字法转换

计算与语言 2022-10-14 v1

摘要

在本文中,我们提出一种 seq2seq 方法,用于将传教士巴萨语正字法音译为官方的正字法。我们的模型使用基于 BERT 的预训练巴萨语传教士和官方正字法语料库。由于巴萨语是一种低资源语言,我们决定在项目中使用 mT5 模型。在训练模型之前,我们对语料库进行了预处理,消除拼写之间的一一对应关系,并将可包含一个或两个字符的变体字符统一为单字符形式。我们最佳的 mT5 模型取得了等于 12.6747 的 CER 和等于 40.1012 的 WER。

关键词

引用

@article{arxiv.2210.06986,
  title  = {Tone prediction and orthographic conversion for Basaa},
  author = {Ilya Nikitin and Brian O'Connor and Anastasia Safonova},
  journal= {arXiv preprint arXiv:2210.06986},
  year   = {2022}
}