TransliCo:一种对比学习框架,用于解决多语言预训练语言模型中的文字屏障
计算与语言
2024-05-24 v2
摘要
世界上超过 7000 种语言至少使用 293 种文字书写。由于种种原因,许多密切相关的语言使用不同的文字,这给多语言预训练语言模型 (mPLM) 通过词汇重叠学习跨语言知识带来了困难。因此,mPLM 面临文字屏障:来自不同文字的表示位于不同的子空间中,这可能导致涉及不同文字语言的跨语言迁移表现不佳。为解决这一问题,我们提出 TransliCo,一个通过优化音译对比建模 (TCM) 目标来微调 mPLM 的框架,该目标通过对比其训练数据中的句子及其在统一文字(本例中为拉丁字母)下的音译,来增强不同文字表示空间的均匀性。我们使用在超过 500 种语言上预训练的 mPLM Glot500-m 作为源模型,在其训练数据的一小部分 (5%) 上对其进行微调,并将所得模型称为 Furina。我们表明,Furina 不仅更好地对齐了来自不同文字的表示,而且在各种零样本跨语言迁移任务上优于原始的 Glot500-m。此外,我们在印度语群的一个案例研究中取得了一致的改进,该语群的语言表现出区域特征但使用不同的文字。我们将代码和模型公开发布。
引用
@article{arxiv.2401.06620,
title = {TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models},
author = {Yihong Liu and Chunlan Ma and Haotian Ye and Hinrich Schütze},
journal= {arXiv preprint arXiv:2401.06620},
year = {2024}
}
备注
ACL 2024