中文

WikiBERT 模型:面向多种语言的深度迁移学习

计算与语言 2020-06-03 v1 机器学习

摘要

BERT 等深度神经语言模型近年来在许多自然语言处理任务中取得了实质性进展。由于其预训练所需的工作量和计算成本,通常仅为英语等少数高资源语言推出特定语言模型。尽管已有覆盖大量语言的多语言模型,但近期研究表明单语训练可产生更优模型,且我们对单语与多语训练之间权衡的理解尚不完整。本文提出一种简单、全自动的流水线,用于从维基百科数据创建特定语言的 BERT 模型,并引入了 42 个此类新模型,其中大多数语言迄今缺乏专用的深度神经语言模型。我们使用最先进的 UDify 解析器在 Universal Dependencies 数据上评估这些模型的优势,并与使用多语言 BERT 模型的结果进行对比。我们发现,使用 WikiBERT 模型的 UDify 平均优于使用 mBERT 的解析器,特定语言模型在某些语言上表现大幅改善,而在其他语言上改进有限或性能下降。我们还呈现了初步结果,作为理解特定语言模型在何种条件下最有益的第一步。本工作中提出的所有方法和模型均可在 https://github.com/turkunlp/wikibert 以开放许可获取。

关键词

引用

@article{arxiv.2006.01538,
  title  = {WikiBERT models: deep transfer learning for many languages},
  author = {Sampo Pyysalo and Jenna Kanerva and Antti Virtanen and Filip Ginter},
  journal= {arXiv preprint arXiv:2006.01538},
  year   = {2020}
}

备注

7 pages, 1 figure