中文

WECHSEL:面向单语语言模型跨语言迁移的子词嵌入高效初始化方法

计算与语言 2022-09-13 v2

摘要

大型预训练语言模型(LMs)已成为许多自然语言处理(NLP)应用的核心构建模块。训练这些模型需要越来越多的计算资源,且现有模型大多仅在英文文本上训练。在其他语言中训练这些模型极其昂贵。为缓解此问题,我们提出一种称为 WECHSEL 的新方法,用于高效且有效地将预训练语言模型迁移到新语言。WECHSEL 可应用于任何使用基于子词的分词并为每个子词学习嵌入的模型。源模型(英文)的分词器被替换为目标语言的分词器,并利用覆盖英文和目标语言的多语静态词嵌入,使词元嵌入初始化为在语义上与英文词元相似。我们使用 WECHSEL 将英文 RoBERTa 和 GPT-2 模型迁移到四种语言(法语、德语、中文和斯瓦希里语)。我们还研究了该方法在极低资源语言上的益处。WECHSEL 优于已有的跨语言参数迁移方法,并以最高 64 倍的更少训练代价优于从头训练的同等规模模型。我们的方法使为新语言训练大型语言模型更易获取且对环境危害更小。我们公开了代码与模型。

关键词

引用

@article{arxiv.2112.06598,
  title  = {WECHSEL: Effective initialization of subword embeddings for cross-lingual transfer of monolingual language models},
  author = {Benjamin Minixhofer and Fabian Paischer and Navid Rekabsaz},
  journal= {arXiv preprint arXiv:2112.06598},
  year   = {2022}
}

备注

NAACL 2022