恩古尼语言的子词分段语言建模
计算与语言
2022-10-14 v1
摘要
子词已成为 NLP 中文本的标准单元,实现了高效的开放词汇模型。借助字节对编码 (BPE) 等算法,子词分割被视为训练前应用于语料的预处理步骤。这可能导致具有复杂形态的低资源语言获得次优分割。我们提出了一种子词分段语言模型 (SSLM),它在训练自回归语言建模的同时学习如何分割词。通过统一子词分割与语言建模,我们的模型学习到优化 LM 性能的的子词。我们在南非的 4 种恩古尼语言上训练模型。这些是低资源黏着语,因此子词信息至关重要。作为 LM,SSLM 在 4 种语言上平均优于现有方法(如基于 BPE 的模型)。此外,在无监督形态分割上它优于标准子词分割器。我们还将我们的模型训练为词级序列模型,由此产生的无监督形态分割器在所有 4 种语言上大幅优于现有方法。我们的结果表明,学习子词分割是现有子词分割器的有效替代方案,使模型能够发现类语素的子词,从而提升其 LM 能力。
引用
@article{arxiv.2210.06525,
title = {Subword Segmental Language Modelling for Nguni Languages},
author = {Francois Meyer and Jan Buys},
journal= {arXiv preprint arXiv:2210.06525},
year = {2022}
}