利用语言实体掩码改进多语言语言模型对低资源语言的跨语言表示
计算与语言
2025-01-13 v1
摘要
在掩码语言建模(MLM)目标上训练的多语言预训练语言模型(multiPLM)通常被用于双语文本挖掘等跨语言任务。然而,这些模型在低资源语言(LRL)上的性能仍然欠佳。为了改进给定 multiPLM 的语言表示,可以对其进行进一步预训练,这被称为持续预训练。先前的研究表明,使用 MLM 以及随后使用翻译语言建模(TLM)进行持续预训练可以改进 multiPLM 的跨语言表示。然而,在掩码过程中,无论 token 的语言属性如何,MLM 和 TLM 对输入序列中的所有 token 赋予相同的权重。在本文中,我们引入了一种新颖的掩码策略,即语言实体掩码(LEM),用于持续预训练步骤,以进一步改进现有 multiPLM 的跨语言表示。与 MLM 和 TLM 相比,LEM 将掩码限制在句子中具有较高显著性的语言实体类型,即名词、动词和命名实体。其次,我们将掩码限制在语言实体跨度内的单个 token 上,从而保留更多上下文,而在 MLM 和 TLM 中,token 是随机掩码的。我们使用三个下游任务评估 LEM 的有效性,即使用三个低资源语言对 English-Sinhala、English-Tamil 和 Sinhala-Tamil 进行双语文本挖掘、平行数据整理和语码混合情感分析。实验结果表明,使用 LEM 持续预训练的 multiPLM 在所有三个任务上均优于使用 MLM+TLM 持续预训练的 multiPLM。
引用
@article{arxiv.2501.05700,
title = {Linguistic Entity Masking to Improve Cross-Lingual Representation of Multilingual Language Models for Low-Resource Languages},
author = {Aloka Fernando and Surangika Ranathunga},
journal= {arXiv preprint arXiv:2501.05700},
year = {2025}
}