中文

利用词汇匹配将 BERT 能力从高资源语言迁移到低资源语言

计算与语言 2024-02-23 v1

摘要

预训练语言模型彻底改变了自然语言理解的格局,其中最著名的是 BERT(Bidirectional Encoder Representations from Transformers)。然而,对于低资源语言而言,由于数据有限阻碍了此类模型的有效训练,仍然是一个重大挑战。本工作提出了一种新颖的方法,通过词汇匹配将 BERT 的能力从高资源语言迁移到低资源语言,以弥合这一差距。我们在西里西亚语和卡舒比语上进行了实验,证明了即使在目标语言训练数据极少的情况下,我们的方法也能有效提高 BERT 模型的性能。我们的结果突出了所提出技术在有效训练低资源语言 BERT 模型方面的潜力,从而 democratizing(普及)了对先进语言理解模型的访问。

关键词

引用

@article{arxiv.2402.14408,
  title  = {Transferring BERT Capabilities from High-Resource to Low-Resource Languages Using Vocabulary Matching},
  author = {Piotr Rybak},
  journal= {arXiv preprint arXiv:2402.14408},
  year   = {2024}
}