南非语言的低资源语言建模
计算与语言
2021-04-05 v1
摘要
语言模型是当前基于神经网络的自然语言理解与生成模型的基础。然而,关于语言模型在非洲语言上内在性能的研究极为有限,而英语及其他高资源语言所缺乏的大型或标准化训练与评测集使得这一研究更具挑战性。本文评估了开放词表语言模型在低资源南非语言上的性能,使用字节对编码来处理这些语言丰富的形态。我们在小规模数据集上评估了 n-gram 模型、前馈神经网络、循环神经网络(RNNs)和 Transformers 的不同变体。总体而言,经过良好正则化的 RNN 在两个 isiZulu 和一个 Sepedi 数据集上取得了最佳性能。多语言训练进一步提升了在这些数据集上的性能。我们希望本研究能为非洲语言的多语言与低资源语言建模研究开辟新的途径。
引用
@article{arxiv.2104.00772,
title = {Low-Resource Language Modelling of South African Languages},
author = {Stuart Mesham and Luc Hayward and Jared Shapiro and Jan Buys},
journal= {arXiv preprint arXiv:2104.00772},
year = {2021}
}
备注
AfricaNLP workshop at EACL 2021