中文

FOCUS:面向多语言模型单语专门化的高效嵌入初始化方法

计算与语言 2024-04-05 v2

摘要

使用在高资源语言上预训练的模型权重作为热启动,可以减少获取其他尤其是低资源语言高质量语言模型所需的数据与计算。然而,若我们想使用专为目标语言定制的新分词器,便无法迁移源模型的嵌入矩阵。本文提出FOCUS——基于Sparsemax的快速重叠词元组合(Fast Overlapping Token Combinations Using Sparsemax),一种新颖的嵌入初始化方法,其基于源模型嵌入矩阵中的信息为新分词器有效初始化嵌入矩阵。FOCUS将新加入的词元表示为源与目标词表重叠部分中词元的组合。重叠词元是根据辅助静态词元嵌入空间中的语义相似度来选取的。我们聚焦于以多语言XLM-R作为源模型,并实证表明FOCUS在语言建模及一系列下游任务(NLI、QA和NER)上优于随机初始化与已有工作。

关键词

引用

@article{arxiv.2305.14481,
  title  = {FOCUS: Effective Embedding Initialization for Monolingual Specialization of Multilingual Models},
  author = {Konstantin Dobler and Gerard de Melo},
  journal= {arXiv preprint arXiv:2305.14481},
  year   = {2024}
}

备注

Accepted to EMNLP 2023 Main Conference (Long Paper). Code: https://github.com/konstantinjdobler/focus