ALIGN-MLM:词嵌入对齐对多语言预训练至关重要
计算与语言
2022-11-17 v1 人工智能
机器学习
摘要
多语言预训练模型展现出零样本跨语言迁移能力,即一个在源语言上微调的模型在目标语言上取得令人惊讶的良好性能。虽有研究试图理解迁移,但仅关注MLM,且自然语言间大量差异使得区分不同性质的重要性变得困难。本文通过提出一种预训练目标(ALIGN-MLM)特别凸显词嵌入对齐的重要性,其辅助损失引导不同语言中的相似词具有相似词嵌入。当我们在自然语言对及其通过系统修改特定性质(如文字系统)得到的对应语言间评估迁移时,ALIGN-MLM优于或匹敌三种广泛采用的目标(MLM、XLM、DICT-MLM)。尤其在文字系统与词序(左到右 vs 右到左)均不同的语言间迁移的POS标注上,ALIGN-MLM以35和30个F1点优于XLM和MLM。我们还显示所有目标下对齐与迁移的强相关性(如XNLI上rho=0.727),结合ALIGN-MLM的强劲表现,呼吁为多语言模型显式对齐词嵌入。
引用
@article{arxiv.2211.08547,
title = {ALIGN-MLM: Word Embedding Alignment is Crucial for Multilingual Pre-training},
author = {Henry Tang and Ameet Deshpande and Karthik Narasimhan},
journal= {arXiv preprint arXiv:2211.08547},
year = {2022}
}