利用词汇匹配将 BERT 能力从高资源语言迁移到低资源语言
计算与语言
2024-02-23 v1
摘要
预训练语言模型彻底改变了自然语言理解的格局,其中最著名的是 BERT(Bidirectional Encoder Representations from Transformers)。然而,对于低资源语言而言,由于数据有限阻碍了此类模型的有效训练,仍然是一个重大挑战。本工作提出了一种新颖的方法,通过词汇匹配将 BERT 的能力从高资源语言迁移到低资源语言,以弥合这一差距。我们在西里西亚语和卡舒比语上进行了实验,证明了即使在目标语言训练数据极少的情况下,我们的方法也能有效提高 BERT 模型的性能。我们的结果突出了所提出技术在有效训练低资源语言 BERT 模型方面的潜力,从而 democratizing(普及)了对先进语言理解模型的访问。
引用
@article{arxiv.2402.14408,
title = {Transferring BERT Capabilities from High-Resource to Low-Resource Languages Using Vocabulary Matching},
author = {Piotr Rybak},
journal= {arXiv preprint arXiv:2402.14408},
year = {2024}
}