中文

迈向完全双语的深度语言建模

计算与语言 2020-10-23 v1

摘要

近年来,基于深度神经网络的语言模型促进了自然语言处理与理解任务的巨大进展。虽然已出现覆盖大量语言的多语言模型,但其多语性是以单语性能为代价换来的,且在大多数不涉及跨语言迁移的任务中表现最佳的模型仍是单语的。在本文中,我们考量是否可能为两种远系语言预训练一个双语模型而不损害任一语言的性能。我们收集预训练数据,创建了一个芬兰语-英语双语BERT模型,并在用于评估相应单语模型的数据集上评估其性能。我们的双语模型在GLUE上与Google原始英文BERT表现相当,并在一系列芬兰语NLP任务上几乎匹配单语芬兰语BERT的性能,明显优于多语BERT。我们发现,当模型词表大小增加时,BERT-Base架构具有足够容量来学习两种远系语言至与单语模型相当的性能水平,证明了训练完全双语深度语言模型的可行性。该模型及其创建中涉及的所有工具均可在 https://github.com/TurkuNLP/biBERT 免费获取。

关键词

引用

@article{arxiv.2010.11639,
  title  = {Towards Fully Bilingual Deep Language Modeling},
  author = {Li-Hsin Chang and Sampo Pyysalo and Jenna Kanerva and Filip Ginter},
  journal= {arXiv preprint arXiv:2010.11639},
  year   = {2020}
}