通过 transliteration-based 后训练对齐打破多语言预训练语言模型的脚本壁垒
计算与语言
2024-10-10 v2
摘要
多语言预训练模型 (mPLMs) 在跨语言迁移任务中展现出惊人的性能。然而,当低资源目标语言的书写脚本与高资源源语言不同时,尽管两种语言可能相关或共享部分词汇,迁移性能常常受到阻碍。鼓舞于最近利用 transliteration 解决此问题的研究后,本文提出了一种基于 transliteration 的后训练对齐 (PPA) 方法,旨在利用多样化脚本改善语言之间的跨语言对齐。我们选取两个区域语言群: 和 ,其中语言彼此受到影响但使用不同的脚本。我们将方法应用于这些语言群,并在广泛的下游任务上进行大量实验。结果表明,PPA 后模型在以英语为中心的迁移中 consistently 优于原始模型(部分任务提升最高可达 50%)。此外,当我们使用除英语之外的语言作为迁移来源时,本方法可获得更大的改进。我们将在 \url{https://github.com/cisnlp/Transliteration-PPA} 公开代码和模型。
引用
@article{arxiv.2406.19759,
title = {Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment},
author = {Orgest Xhelili and Yihong Liu and Hinrich Schütze},
journal= {arXiv preprint arXiv:2406.19759},
year = {2024}
}
备注
EMNLP 2024 Findings