中文

多语并不够:面向芬兰语的 BERT

计算与语言 2019-12-17 v1

摘要

基于深度学习、在大型无标注文本语料上预训练的语言模型已被证明可为自然语言处理提供高效的迁移学习,近期如基于 transformer 的 BERT 模型等方法在推进各类任务的最先进水平。虽然这些模型的大部分工作聚焦于高资源语言,尤其是英语,一些近期努力引入了多语言模型,可微调以处理大量不同语言的任务。然而,我们仍缺乏对这些模型能力的透彻理解,特别是对低资源语言。本文聚焦芬兰语,在多类任务上彻底评估多语言 BERT 模型,并与从头训练的新芬兰语 BERT 模型比较。新的特定语言模型被证明系统性且明显优于多语言模型。多语言模型在很大程度上未能达到先前提出方法的性能,而定制的芬兰语 BERT 模型在所有语料的所有参考任务上确立了新的最先进水平:词性标注、命名实体识别和依存句法分析。我们以开放许可在 https://turkunlp.org/finbert 发布本研究所用的模型及所有相关资源。

关键词

引用

@article{arxiv.1912.07076,
  title  = {Multilingual is not enough: BERT for Finnish},
  author = {Antti Virtanen and Jenna Kanerva and Rami Ilo and Jouni Luoma and Juhani Luotolahti and Tapio Salakoski and Filip Ginter and Sampo Pyysalo},
  journal= {arXiv preprint arXiv:1912.07076},
  year   = {2019}
}