非洲低资源语言的文本规范化
计算与语言
2021-03-31 v1
摘要
机器学习模型的训练数据可来自许多不同来源,其质量可能存疑。对于英语等资源丰富语言,可用数据很多,因此我们可舍弃存疑数据。对于可用数据少得多的低资源语言,我们未必能舍弃存疑数据,以免最终得到的训练集过小而无法训练模型。本研究中,我们考察了一组非洲低资源语言——阿非利卡语、阿姆哈拉语、豪萨语、伊博语、马达加斯加语、索马里语、斯瓦希里语和祖鲁语——的文本规范化与数据集质量的影响。我们描述了在 Pynini 框架(一个用于有限状态转换器的 Python 库)中构建的文本规范化器,以及使用自然语言工具包(NLTK,一个开源 Python NLP 库)训练非洲语言语言模型的实验。
引用
@article{arxiv.2103.15845,
title = {Text Normalization for Low-Resource Languages of Africa},
author = {Andrew Zupon and Evan Crew and Sandy Ritchie},
journal= {arXiv preprint arXiv:2103.15845},
year = {2021}
}
备注
to be presented at AfricaNLP 2021