显式形态学知识改进希伯来语语言模型的预训练
计算与语言
2023-11-02 v1
摘要
预训练语言模型(PLMs)仅依靠文本流上的自监督训练,已展现出在获取广泛语言知识方面的显著成功。然而,这种与语言无关的方法在应用于形态丰富语言(MRLs)时表现欠佳,其有效性屡受质疑。我们研究如下假设:在预训练阶段引入显式形态学知识可提升 PLMs 在 MRLs 上的性能。我们提出多种由形态驱动的分词方法,使模型能够利用原始文本之外的形态线索。我们利用不同方法预训练了多个语言模型,并在形态复杂且高度歧义的希伯来语上对其进行评估。我们的实验表明,在语义与形态学任务的基准上,形态驱动的分词相较于标准的不区分语言的分词取得了更优结果。这些发现表明,融入形态学知识具有进一步提升形态丰富语言 PLMs 的潜力。
引用
@article{arxiv.2311.00658,
title = {Explicit Morphological Knowledge Improves Pre-training of Language Models for Hebrew},
author = {Eylon Gueta and Omer Goldman and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2311.00658},
year = {2023}
}